Исследования29 сентября 2026 г., 10:17 МСК🤖 Auto

HARDEN: Эволюционный поиск делает тесты для LLM сложнее на 50%

Исследователи представили метод HARDEN, который автоматически усложняет бенчмарки для LLM, сохраняя правильные ответы. Тесты стали жестче: точность моделей Qwen3.5 упала в среднем на 22,7%.

Баннер новости 8490

Проблема «мягких» бенчмарков

Стандартные наборы данных для оценки языковых моделей (LLM) часто не отражают реальную сложность корпоративных задач. Они слишком просты или содержат шаблоны, которые модели учатся обходить, а не решать. Чтобы исправить это, команда исследователей во главе с Адитьей Кумараном (Aditya Kumaran) разработала метод HARDEN (Constrained Evolutionary Search for Harder, Answer-Preserving Evaluation Cases).

Суть метода — эволюционный поиск, который модифицирует входные данные существующих тестовых случаев, делая их сложнее, но строго сохраняя исходный правильный ответ и семантику задачи. Это позволяет измерить истинную способность модели к рассуждению, а не запоминанию паттернов.

Как работает HARDEN

Алгоритм генерирует варианты входных данных, двигаясь по «осям сложности», специфичным для домена. При этом он накладывает жесткие ограничения (constraints), чтобы гарантировать:

  • Сохранение семантики: задача остается той же самой.
  • Реалистичность: сгенерированный текст выглядит естественно.
  • Валидность выполнения: модель все еще может найти решение, если оно существует.

Результаты на моделях Qwen3.5

Эксперименты проводились на трех наборах данных: FinQA (финансовая аналитика), PubMedQA (медицинские вопросы) и ContractNLI (понимание контрактов). В качестве тестовых моделей использовались три масштаба Qwen3.5: 35B-A3B, 122B-A10B и 397B-A17B.

Метод HARDEN показал значительное снижение точности по сравнению с базовыми тестами, что доказывает эффективность усложнения. Ниже приведены ключевые метрики снижения точности (accuracy drop) относительно базовых проходов:

Метрика Значение Комментарий
Среднее снижение точности 22.7% По всем моделям и датасетам
Максимальное снижение до 49.9% Относительно базовых проходов с теми же проверками
Масштабы моделей 35B, 122B, 397B Серия Qwen3.5 (MoE-архитектура)

Почему это важно

Результаты показывают, что эволюционный поиск способен генерировать валидные, но существенно более сложные тестовые случаи. Для индустрии это означает переход от оценки «умения отвечать на простые вопросы» к оценке способности модели справляться с зашумленными, сложными и реалистичными входными данными, что критически важно для внедрения LLM в enterprise-среду.

Источник: arXiv cs.AI ↗