От абстрактных метрик к реальной разработке
Создание LLM-агентов для бизнеса перешло от экспериментов к производству. Однако существующие бенчмарки не оценивают способность ИИ-систем выполнять полноценный цикл разработки: от анализа требований клиента до развертывания кода. Авторы работы из Princeton и других институтов представили τ^τ-Bench (читается как "hyper-tau-bench"), который ставит задачу построения агента в центр оценки.
В отличие от стандартных тестов, среда симулирует реальные условия клиентского заказа: у агента-разработчика есть доступ к реальным бизнес-записям, API операционной системы, унаследованному коду, а также жесткие ограничения по стоимости обслуживания и выбору моделей. Задача — создать полноценного агента обслуживания клиентов, который затем тестируется на скрытой выборке симулированных пользователей.
Результаты: разрыв между ожиданиями и реальностью
Тестирование проводилось на 53 задачах, охватывающих четыре различные предметные области. Результаты оказались шокирующе низкими для индустрии, ожидающей от ИИ полной автономности. Даже самая мощная конфигурация, использующая модель Claude Opus 5 в связке с Claude Code, справилась лишь с 23.9% симуляций.
Для сравнения, потолок производительности, установленный экспертами-людьми (reference ceiling), составляет 82.2%. Это означает, что текущие SOTA-модели не способны самостоятельно довести проект до уровня, доступного среднему разработчику.
| Конфигурация / Модель | Результат (% успешных симуляций) | Примечание |
|---|---|---|
| Эксперт-человек (Reference Ceiling) | 82.2% | Максимально возможный результат, заданный профессионалами |
| Claude Opus 5 + Claude Code | 23.9% | Лучший результат среди ИИ-систем |
Почему ИИ-агенты проваливают тест?
Анализ ошибок выявил паттерны, знакомые каждому human-agent developer. Основные причины провалов:
- Поверхностное понимание данных: модели выдают легкие запросы вместо глубокого анализа бизнес-записей.
- Отсутствие коммуникации: ИИ почти не взаимодействует с "клиентом" (симулятором требований), не уточняя задачи.
- Недостаточная итеративность: агенты слишком мало экспериментируют с архитектурой и оптимизацией затрат, отправляя на тестирование первую же работающую, но неэффективную версию.
Исследование τ^τ-Bench демонстрирует, что создание кооперативных ИИ-агентов — это не просто задача генерации кода, а сложный процесс инженерии, требующий глубокого контекстного понимания и итеративного улучшения, с которыми современные LLM пока справляются крайне плохо.
Источник: arXiv cs.AI ↗
