Исследования14 июля 2026 г., 17:17 МСК🤖 Auto

Конец гонке за бенчмарками? IRT-анализ показывает убывающую отдачу от роста датасетов

Исследование на базе Omni-MATH с использованием теории Item Response Theory (IRT) доказывает: добавление новых вопросов в бенчмарки дает всё меньшую информацию о способностях LLM. Для оценки этого эффекта требуется не просто больше данных, а новые мо

Баннер новости 3548

Суть проблемы: иллюзия независимости данных

Стандартная практика оценки LLM предполагает, что каждый новый вопрос в бенчмарке добавляет фиксированный объем информации о «латентной способности» модели. Однако реальность сложнее: вопросы коррелируют между собой (например, вопросы про птиц и рептилий могут опираться на общие знания). Это приводит к убывающей предельной отдаче (diminishing returns) — чем больше вопросов, тем меньше новая информация от каждого следующего.

Авторы исследования, проведенного в рамках Pivotal Fellowship, использовали Item Response Theory (IRT) для формализации этого эффекта. Ключевой метрикой стал коэффициент дефляции информации (f), который показывает, насколько быстро падает полезность добавления новых элементов в датасет.

Методология и ключевые цифры

В качестве тестовой среды выступил датасет Omni-MATH (около 1000 вопросов). Исследователи оценивали способность моделей предсказывать результаты на основе латентного фактора θ. Главной задачей стало определение параметра ρ (rho), который характеризует скорость убывания отдачи. Теоретически, если ρ стремится к нулю, отдача линейна. Если ρ велико — отдача падает быстро.

Попытки оценить ρ на малой выборке (200 вопросов) показали высокую шумность. Ниже приведена эволюция оценок параметра ρ и соответствующего «потолка» информации:

Метод оценки Значение ρ Макс. информация (Ceiling) Примечание
Наивная оценка (с ошибкой) 0.0391 ~26 Ошибка: использовано кол-во моделей (70) вместо вопросов (1000)
Исправленная (plain scalar) 0.0019 ~518 Эмпирическая калибровка, допущение равной информации вопросов
Info-weighted 0.0013 ~746 Взвешивание по информации Фишера
Slope fit (полный датасет) 0.0008 ~1263 Наиболее точная эмпирическая оценка

Почему это важно для индустрии

Результат ρ ≈ 0.0008 подтверждает теоретическую модель: отдача от расширения бенчмарков действительно убывает, но не так катастрофически, как можно было опасаться при грубых оценках. Однако главная проблема — статистическая шумность.

Исследование показывает, что для надежной оценки этого эффекта недостаточно просто собрать больше вопросов. Стандартная ошибка оценки ρ зависит от количества протестированных моделей (N), а не вопросов (n). При фиксированном наборе моделей (например, 50-100 современных LLM) отношение сигнал/шум составляет всего ~2-2.5x.

  • Для создателей бенчмарков: Просто добавлять вопросы становится неэффективно. Нужно фокусироваться на разнообразии тематик, чтобы минимизировать корреляцию остатков.
  • Для разработчиков моделей: Сравнение на одном и том же бенчмарке может давать ложное ощущение прогресса, если не учитывать дефляцию информации. Рост на 1% в Omni-MATH может означать разный прирост «истинной способности» в зависимости от стадии насыщения датасета.

Вывод

Исследование ставит точку в спорах о «бесконечном росте» от расширения тестов. Мы достигли точки, где для получения значимых метрик качества оценки требуется не просто масштабирование данных, а масштабирование разнообразия моделей, участвующих в тестировании. Без новых архитектур и подходов к оценке, даже идеальные бенчмарки упрутся в статистический потолок.

Источник: LessWrong ↗