Исследования5 августа 2026 г., 05:16 МСК🤖 Auto

CurveShift: Истинный прогресс LLM скрыт в сложных задачах

Исследование CurveShift доказывает, что рост метрик LLM часто объясняется эффектом потолка, а не новыми способностями. Однако модели после сентября 2024 года показывают реальный скачок в решении сложных задач.

Баннер новости 5096

Проблема скалярных метрик

Прогресс в области больших языковых моделей (LLM) традиционно оценивается через единые скалярные показатели: временные горизонты, оценки латентных способностей или агрегированные баллы бенчмарков. Авторы исследования из CurveShift утверждают, что такие метрики скрывают реальную картину, создавая иллюзию качественного изменения архитектуры или логики работы моделей. На данных METR видно, что рост производительности на сложных задачах часто объясняется просто повышением общего уровня модели (эффект потолка), а не изменением формы кривой сложности.

Методология: LiveCodeBench как контрольная группа

Главная проблема анализа агентных бенчмарков — смешивание прогресса модели с улучшением инструментов (harnesses). Чтобы изолировать именно способности модели, исследователи использовали LiveCodeBench — публичный бенчмарк по конкурентному программированию, который не использует агентных оболочек. Они сопоставили 66 датированных моделей с 1 055 задачами, имеющими экзогенный порядок сложности. Это позволило отделить рост «базового уровня» от реального улучшения в решении сложных проблем.

Ключевые цифры и результаты

После учета общего роста способностей, модели, выпущенные после сентября 2024 года, демонстрируют статистически значимый прогресс именно на самых сложных задачах. Этот эффект особенно выражен у сильных моделей с развитым reasoning (способностью к рассуждению).

Показатель До сентября 2024 (базовый уровень) После сентября 2024 (реальный прирост)
Изменение сложности (logits) +0.40 logits (консервативная оценка)
Решаемость сложных задач ~18% ~25%
Тип задач Легкие/Средние (объясняются общим ростом) Сложные (требуют короткого, но глубокого рассуждения)

Важность для индустрии

Результаты показывают, что заявленные «эмерджентные способности» часто являются артефактом выбора метрик. Однако выделенный эффект в +0.40 logits на сложных задачах указывает на то, что современные модели действительно научились лучше справляться с нетривиальным логическим выводом, а не просто запоминают паттерны. Исследователи публикуют LiveCodeBench Difficulty Panel и код анализа, что позволяет независимым экспертам верифицировать эти выводы.

Источник: arXiv cs.CL ↗