Суть проблемы: иллюзия независимости данных
Стандартная практика оценки LLM предполагает, что каждый новый вопрос в бенчмарке добавляет фиксированный объем информации о «латентной способности» модели. Однако реальность сложнее: вопросы коррелируют между собой (например, вопросы про птиц и рептилий могут опираться на общие знания). Это приводит к убывающей предельной отдаче (diminishing returns) — чем больше вопросов, тем меньше новая информация от каждого следующего.
Авторы исследования, проведенного в рамках Pivotal Fellowship, использовали Item Response Theory (IRT) для формализации этого эффекта. Ключевой метрикой стал коэффициент дефляции информации (f), который показывает, насколько быстро падает полезность добавления новых элементов в датасет.
Методология и ключевые цифры
В качестве тестовой среды выступил датасет Omni-MATH (около 1000 вопросов). Исследователи оценивали способность моделей предсказывать результаты на основе латентного фактора θ. Главной задачей стало определение параметра ρ (rho), который характеризует скорость убывания отдачи. Теоретически, если ρ стремится к нулю, отдача линейна. Если ρ велико — отдача падает быстро.
Попытки оценить ρ на малой выборке (200 вопросов) показали высокую шумность. Ниже приведена эволюция оценок параметра ρ и соответствующего «потолка» информации:
| Метод оценки | Значение ρ | Макс. информация (Ceiling) | Примечание |
|---|---|---|---|
| Наивная оценка (с ошибкой) | 0.0391 | ~26 | Ошибка: использовано кол-во моделей (70) вместо вопросов (1000) |
| Исправленная (plain scalar) | 0.0019 | ~518 | Эмпирическая калибровка, допущение равной информации вопросов |
| Info-weighted | 0.0013 | ~746 | Взвешивание по информации Фишера |
| Slope fit (полный датасет) | 0.0008 | ~1263 | Наиболее точная эмпирическая оценка |
Почему это важно для индустрии
Результат ρ ≈ 0.0008 подтверждает теоретическую модель: отдача от расширения бенчмарков действительно убывает, но не так катастрофически, как можно было опасаться при грубых оценках. Однако главная проблема — статистическая шумность.
Исследование показывает, что для надежной оценки этого эффекта недостаточно просто собрать больше вопросов. Стандартная ошибка оценки ρ зависит от количества протестированных моделей (N), а не вопросов (n). При фиксированном наборе моделей (например, 50-100 современных LLM) отношение сигнал/шум составляет всего ~2-2.5x.
- Для создателей бенчмарков: Просто добавлять вопросы становится неэффективно. Нужно фокусироваться на разнообразии тематик, чтобы минимизировать корреляцию остатков.
- Для разработчиков моделей: Сравнение на одном и том же бенчмарке может давать ложное ощущение прогресса, если не учитывать дефляцию информации. Рост на 1% в Omni-MATH может означать разный прирост «истинной способности» в зависимости от стадии насыщения датасета.
Вывод
Исследование ставит точку в спорах о «бесконечном росте» от расширения тестов. Мы достигли точки, где для получения значимых метрик качества оценки требуется не просто масштабирование данных, а масштабирование разнообразия моделей, участвующих в тестировании. Без новых архитектур и подходов к оценке, даже идеальные бенчмарки упрутся в статистический потолок.
Источник: LessWrong ↗
