Исследования13 июля 2026 г., 08:16 МСК🤖 Auto

Long-Horizon-Terminal-Bench: AI-агенты провалили сложные задачи с точностью 15%

Исследователи представили Long-Horizon-Terminal-Bench — новый бенчмарк для тестирования AI-агентов на длительных терминальных задачах. Лучшие модели показывают лишь 15.2% успеха, раскрывая критические пробелы в планировании и отладке.

Баннер новости 3428

Проблема старых бенчмарков

Существующие тесты для AI-агентов (например, Terminal-Bench) фокусируются на коротких задачах, решаемых за минуты, и оценивают только финальный результат. Это создает «разреженные» сигналы вознаграждения (sparse reward), игнорируя промежуточный прогресс. Новая работа от команды во главе с Zongxia Li (включая авторов из Университета Джонса Хопкинса и других институтов) предлагает решение: Long-Horizon-Terminal-Bench (LHT-Bench).

Масштаб и структура теста

LHT-Bench состоит из 46 задач, охватывающих 9 категорий, включая воспроизведение экспериментов, программную инженерию, мультимодальный анализ и научные вычисления. Ключевое отличие — декомпозиция каждой задачи на мелкие подзадачи с детальной оценкой. Это позволяет получать «плотные» награды за частичное выполнение, что критично для оценки способности агента к долгосрочному планированию и итеративной отладке.

Ключевые метрики производительности

Авторы протестировали 15 передовых моделей. Результаты показали, что даже самые сильные агенты испытывают колоссальные трудности. Средний расход ресурсов на одну задачу составляет 9.9 млн токенов, 231 эпизод и 85.3 минуты выполнения. Ниже приведена сравнительная таблица успешности моделей на разных порогах оценки:

Метрика оценки Лучший результат (Pass@1) Средний результат (Pass@1) Интерпретация
Частичное вознаграждение (порог 0.95) 15.2% 4.3% Агент выполнил задачу с незначительными ошибками
Идеальное вознаграждение (порог 1.0) 10.9% 1.7% Агент выполнил задачу безупречно

Почему это важно

Низкие показатели (особенно 1.7% среднего успеха при идеальной оценке) демонстрируют, что современные AI-агенты не готовы к автономному решению сложных, многоэтапных рабочих процессов. Проблемы кроются не в знании синтаксиса, а в управлении длинным контекстом и способности исправлять ошибки в ходе выполнения. LHT-Bench открыт для сообщества и станет стандартом для оценки следующего поколения агентов, способных работать в реальных, «грязных» условиях терминала.

Источник: arXiv cs.AI ↗