Исследования6 августа 2026 г., 01:17 МСК🤖 Auto

Terminal-Bench 2.0: Разница в рейтинге — это шум или навык?

Анализ лидерборда Terminal-Bench 2.0 показал, что 23% пар моделей статистически неотличимы. Выбор «обвязки» (scaffold) часто важнее самой модели.

Баннер новости 5165

Шум вместо разрыва в навыках

Анализ лидерборда Terminal-Bench 2.0, одного из самых авторитетных бенчмарков для AI-агентов, выявил критическую проблему: разница в баллах между соседними позициями часто является статистическим шумом. Исследователь nateg551015 проанализировал 325 пар агентов, используя кластеризованную бутстрап-оценку с поправкой Бенджамини-Хохберга. Результат: 23% пар оказались статистически эквивалентными.

Особенно это заметно в топе: с 5-го по 13-е место разброс составляет всего 5 процентных пунктов (от 67% до 62%). При этом надежность моделей высока (ICC 0.5–0.8), что исключает случайность как причину нестабильности самих агентов. Проблема в недостатке задач для достижения статистической значимости при текущем количестве попыток.

Обвязка важнее модели

Главный инсайт исследования: выбор «scaffold» (инфраструктуры, управляющей агентом) влияет на результат сильнее, чем переход от модели №2 к модели №3. Если зафиксировать модель и менять обвязку, разница в баллах часто превышает разницу между топовыми моделями.

Модель Кол-во протестированных обвязок Разброс баллов (span)
Claude Opus 4.5 4 15 пунктов
Claude Haiku 4.5 2 22 пункта
Claude Opus 4.6 2 8 пунктов
Qwen3-Coder-480B 3 6 пунктов
Gemini 3 Pro 4 4 пункта (инвариантна к обвязке)

Почему это важно для разработчиков

Наивный анализ, считающий все 52 104 попытки независимыми, ошибочно занижает доверительные интервалы в два раза, так как множественные попытки на одной задаче сильно коррелируют. Это создает иллюзию точности рейтинга.

Вместо того чтобы тратить ресурсы на выбор между статистически равными топ-агентами, командам следует фокусироваться на оптимизации scaffold. Исследование использует данные с tbench.ai и методологию, опубликованную под лицензией Apache 2.0, что позволяет воспроизвести выводы для собственных проектов.

Источник: LessWrong ↗