Исследования18 сентября 2026 г., 07:21 МСК🤖 Auto

Кризис доверия: как LLM-бенчмарки стали отражением самих моделей

Исследование 14 767 статей выявило, что тесты для LLM всё чаще создаются самими моделями, что ставит под угрозу объективность оценки прогресса в AI.

Баннер новости 7769

Масштаб анализа: от MMLU к агентным задачам

Исследователь Чао Ван (Chao Wang) проанализировал 14 767 статей, опубликованных на arXiv в период с января 2022 по август 2026 года. Цель работы — понять, как меняются ожидания от больших языковых моделей (LLM) через призму дизайна тестов. Если раньше фокус был на статичных знаниях, то сейчас наблюдается резкий сдвиг в сторону действия, взаимодействия и профессиональных приложений.

Трансформация метрик: кто оценивает результат?

Ключевая находка исследования касается механизмов скоринга. Наблюдается рост использования LLM для оценки ответов других моделей (LLM-as-a-judge). Однако этот процесс нелинеен: в то время как в агентных задачах использование моделей-оценчиков растет, в генерации материалов для тестов (model-generated materials) устойчивого увеличения не зафиксировано. Это создает риск самоподкрепляющейся системы, где модели тестируют модели.

Сравнительная динамика элементов бенчмарков

Авторы выделили ключевые тренды в эволюции тестовых наборов. Ниже представлена динамика основных характеристик, выявленных в ходе анализа:

Характеристика бенчмарка Наблюдаемый тренд (2022–2026) Значение для индустрии
Фокус задач Сдвиг к действию и взаимодействию Статичные QA-тесты уступают место агентным сценариям
Механизм оценки Рост LLM-based scoring Риск субъективности и воспроизведения bias самих моделей
Генерация данных Отсутствие устойчивого роста Человеческий фактор или внешние источники остаются важными
Совместимость элементов Коэкзистенция старых и новых Индустирия не отказывается от классических метрик полностью

Проблема «слепых пятен»

Исследование поднимает критический вопрос: обеспечивает ли расширение количества тестов независимым доказательством прогресса, или же мы рискуем просто воспроизвести предпочтения и «слепые пятна» участвующих в тестировании моделей? Когда AI участвует в конструировании тестов, их выполнении и оценке, граница между объективным измерением и самореферентной валидацией размывается.

Вывод для разработчиков

Для создателей LLM важно осознавать, что публичные рейтинги могут быть искажены методологией оценки. Прозрачность в том, кто и как оценивает модель, становится таким же важным артефактом, как и сама архитектура модели. Исследование доступно по ссылке: arXiv:2609.19182.

Источник: arXiv cs.AI ↗