Проблема «мягких» бенчмарков
Стандартные наборы данных для оценки языковых моделей (LLM) часто не отражают реальную сложность корпоративных задач. Они слишком просты или содержат шаблоны, которые модели учатся обходить, а не решать. Чтобы исправить это, команда исследователей во главе с Адитьей Кумараном (Aditya Kumaran) разработала метод HARDEN (Constrained Evolutionary Search for Harder, Answer-Preserving Evaluation Cases).
Суть метода — эволюционный поиск, который модифицирует входные данные существующих тестовых случаев, делая их сложнее, но строго сохраняя исходный правильный ответ и семантику задачи. Это позволяет измерить истинную способность модели к рассуждению, а не запоминанию паттернов.
Как работает HARDEN
Алгоритм генерирует варианты входных данных, двигаясь по «осям сложности», специфичным для домена. При этом он накладывает жесткие ограничения (constraints), чтобы гарантировать:
- Сохранение семантики: задача остается той же самой.
- Реалистичность: сгенерированный текст выглядит естественно.
- Валидность выполнения: модель все еще может найти решение, если оно существует.
Результаты на моделях Qwen3.5
Эксперименты проводились на трех наборах данных: FinQA (финансовая аналитика), PubMedQA (медицинские вопросы) и ContractNLI (понимание контрактов). В качестве тестовых моделей использовались три масштаба Qwen3.5: 35B-A3B, 122B-A10B и 397B-A17B.
Метод HARDEN показал значительное снижение точности по сравнению с базовыми тестами, что доказывает эффективность усложнения. Ниже приведены ключевые метрики снижения точности (accuracy drop) относительно базовых проходов:
| Метрика | Значение | Комментарий |
|---|---|---|
| Среднее снижение точности | 22.7% | По всем моделям и датасетам |
| Максимальное снижение | до 49.9% | Относительно базовых проходов с теми же проверками |
| Масштабы моделей | 35B, 122B, 397B | Серия Qwen3.5 (MoE-архитектура) |
Почему это важно
Результаты показывают, что эволюционный поиск способен генерировать валидные, но существенно более сложные тестовые случаи. Для индустрии это означает переход от оценки «умения отвечать на простые вопросы» к оценке способности модели справляться с зашумленными, сложными и реалистичными входными данными, что критически важно для внедрения LLM в enterprise-среду.
Источник: arXiv cs.AI ↗
