Шум вместо разрыва в навыках
Анализ лидерборда Terminal-Bench 2.0, одного из самых авторитетных бенчмарков для AI-агентов, выявил критическую проблему: разница в баллах между соседними позициями часто является статистическим шумом. Исследователь nateg551015 проанализировал 325 пар агентов, используя кластеризованную бутстрап-оценку с поправкой Бенджамини-Хохберга. Результат: 23% пар оказались статистически эквивалентными.
Особенно это заметно в топе: с 5-го по 13-е место разброс составляет всего 5 процентных пунктов (от 67% до 62%). При этом надежность моделей высока (ICC 0.5–0.8), что исключает случайность как причину нестабильности самих агентов. Проблема в недостатке задач для достижения статистической значимости при текущем количестве попыток.
Обвязка важнее модели
Главный инсайт исследования: выбор «scaffold» (инфраструктуры, управляющей агентом) влияет на результат сильнее, чем переход от модели №2 к модели №3. Если зафиксировать модель и менять обвязку, разница в баллах часто превышает разницу между топовыми моделями.
| Модель | Кол-во протестированных обвязок | Разброс баллов (span) |
|---|---|---|
| Claude Opus 4.5 | 4 | 15 пунктов |
| Claude Haiku 4.5 | 2 | 22 пункта |
| Claude Opus 4.6 | 2 | 8 пунктов |
| Qwen3-Coder-480B | 3 | 6 пунктов |
| Gemini 3 Pro | 4 | 4 пункта (инвариантна к обвязке) |
Почему это важно для разработчиков
Наивный анализ, считающий все 52 104 попытки независимыми, ошибочно занижает доверительные интервалы в два раза, так как множественные попытки на одной задаче сильно коррелируют. Это создает иллюзию точности рейтинга.
Вместо того чтобы тратить ресурсы на выбор между статистически равными топ-агентами, командам следует фокусироваться на оптимизации scaffold. Исследование использует данные с tbench.ai и методологию, опубликованную под лицензией Apache 2.0, что позволяет воспроизвести выводы для собственных проектов.
Источник: LessWrong ↗
