Проблема скалярных метрик
Прогресс в области больших языковых моделей (LLM) традиционно оценивается через единые скалярные показатели: временные горизонты, оценки латентных способностей или агрегированные баллы бенчмарков. Авторы исследования из CurveShift утверждают, что такие метрики скрывают реальную картину, создавая иллюзию качественного изменения архитектуры или логики работы моделей. На данных METR видно, что рост производительности на сложных задачах часто объясняется просто повышением общего уровня модели (эффект потолка), а не изменением формы кривой сложности.
Методология: LiveCodeBench как контрольная группа
Главная проблема анализа агентных бенчмарков — смешивание прогресса модели с улучшением инструментов (harnesses). Чтобы изолировать именно способности модели, исследователи использовали LiveCodeBench — публичный бенчмарк по конкурентному программированию, который не использует агентных оболочек. Они сопоставили 66 датированных моделей с 1 055 задачами, имеющими экзогенный порядок сложности. Это позволило отделить рост «базового уровня» от реального улучшения в решении сложных проблем.
Ключевые цифры и результаты
После учета общего роста способностей, модели, выпущенные после сентября 2024 года, демонстрируют статистически значимый прогресс именно на самых сложных задачах. Этот эффект особенно выражен у сильных моделей с развитым reasoning (способностью к рассуждению).
| Показатель | До сентября 2024 (базовый уровень) | После сентября 2024 (реальный прирост) |
|---|---|---|
| Изменение сложности (logits) | — | +0.40 logits (консервативная оценка) |
| Решаемость сложных задач | ~18% | ~25% |
| Тип задач | Легкие/Средние (объясняются общим ростом) | Сложные (требуют короткого, но глубокого рассуждения) |
Важность для индустрии
Результаты показывают, что заявленные «эмерджентные способности» часто являются артефактом выбора метрик. Однако выделенный эффект в +0.40 logits на сложных задачах указывает на то, что современные модели действительно научились лучше справляться с нетривиальным логическим выводом, а не просто запоминают паттерны. Исследователи публикуют LiveCodeBench Difficulty Panel и код анализа, что позволяет независимым экспертам верифицировать эти выводы.
Источник: arXiv cs.CL ↗
