Масштаб анализа: от MMLU к агентным задачам
Исследователь Чао Ван (Chao Wang) проанализировал 14 767 статей, опубликованных на arXiv в период с января 2022 по август 2026 года. Цель работы — понять, как меняются ожидания от больших языковых моделей (LLM) через призму дизайна тестов. Если раньше фокус был на статичных знаниях, то сейчас наблюдается резкий сдвиг в сторону действия, взаимодействия и профессиональных приложений.
Трансформация метрик: кто оценивает результат?
Ключевая находка исследования касается механизмов скоринга. Наблюдается рост использования LLM для оценки ответов других моделей (LLM-as-a-judge). Однако этот процесс нелинеен: в то время как в агентных задачах использование моделей-оценчиков растет, в генерации материалов для тестов (model-generated materials) устойчивого увеличения не зафиксировано. Это создает риск самоподкрепляющейся системы, где модели тестируют модели.
Сравнительная динамика элементов бенчмарков
Авторы выделили ключевые тренды в эволюции тестовых наборов. Ниже представлена динамика основных характеристик, выявленных в ходе анализа:
| Характеристика бенчмарка | Наблюдаемый тренд (2022–2026) | Значение для индустрии |
|---|---|---|
| Фокус задач | Сдвиг к действию и взаимодействию | Статичные QA-тесты уступают место агентным сценариям |
| Механизм оценки | Рост LLM-based scoring | Риск субъективности и воспроизведения bias самих моделей |
| Генерация данных | Отсутствие устойчивого роста | Человеческий фактор или внешние источники остаются важными |
| Совместимость элементов | Коэкзистенция старых и новых | Индустирия не отказывается от классических метрик полностью |
Проблема «слепых пятен»
Исследование поднимает критический вопрос: обеспечивает ли расширение количества тестов независимым доказательством прогресса, или же мы рискуем просто воспроизвести предпочтения и «слепые пятна» участвующих в тестировании моделей? Когда AI участвует в конструировании тестов, их выполнении и оценке, граница между объективным измерением и самореферентной валидацией размывается.
Вывод для разработчиков
Для создателей LLM важно осознавать, что публичные рейтинги могут быть искажены методологией оценки. Прозрачность в том, кто и как оценивает модель, становится таким же важным артефактом, как и сама архитектура модели. Исследование доступно по ссылке: arXiv:2609.19182.
Источник: arXiv cs.AI ↗
