Исследования7 сентября 2026 г., 19:18 МСК🤖 Auto

Claude Opus 5 на 23.9%: новый бенчмарк показал провал AI-агентов

Исследователи представили τ^τ-Bench — среду для оценки способности LLM создавать рабочих агентов. Даже флагманские модели провалили тест, показав результат ниже 24%.

Баннер новости 6951

От абстрактных метрик к реальной разработке

Создание LLM-агентов для бизнеса перешло от экспериментов к производству. Однако существующие бенчмарки не оценивают способность ИИ-систем выполнять полноценный цикл разработки: от анализа требований клиента до развертывания кода. Авторы работы из Princeton и других институтов представили τ^τ-Bench (читается как "hyper-tau-bench"), который ставит задачу построения агента в центр оценки.

В отличие от стандартных тестов, среда симулирует реальные условия клиентского заказа: у агента-разработчика есть доступ к реальным бизнес-записям, API операционной системы, унаследованному коду, а также жесткие ограничения по стоимости обслуживания и выбору моделей. Задача — создать полноценного агента обслуживания клиентов, который затем тестируется на скрытой выборке симулированных пользователей.

Результаты: разрыв между ожиданиями и реальностью

Тестирование проводилось на 53 задачах, охватывающих четыре различные предметные области. Результаты оказались шокирующе низкими для индустрии, ожидающей от ИИ полной автономности. Даже самая мощная конфигурация, использующая модель Claude Opus 5 в связке с Claude Code, справилась лишь с 23.9% симуляций.

Для сравнения, потолок производительности, установленный экспертами-людьми (reference ceiling), составляет 82.2%. Это означает, что текущие SOTA-модели не способны самостоятельно довести проект до уровня, доступного среднему разработчику.

Конфигурация / Модель Результат (% успешных симуляций) Примечание
Эксперт-человек (Reference Ceiling) 82.2% Максимально возможный результат, заданный профессионалами
Claude Opus 5 + Claude Code 23.9% Лучший результат среди ИИ-систем

Почему ИИ-агенты проваливают тест?

Анализ ошибок выявил паттерны, знакомые каждому human-agent developer. Основные причины провалов:

  • Поверхностное понимание данных: модели выдают легкие запросы вместо глубокого анализа бизнес-записей.
  • Отсутствие коммуникации: ИИ почти не взаимодействует с "клиентом" (симулятором требований), не уточняя задачи.
  • Недостаточная итеративность: агенты слишком мало экспериментируют с архитектурой и оптимизацией затрат, отправляя на тестирование первую же работающую, но неэффективную версию.

Исследование τ^τ-Bench демонстрирует, что создание кооперативных ИИ-агентов — это не просто задача генерации кода, а сложный процесс инженерии, требующий глубокого контекстного понимания и итеративного улучшения, с которыми современные LLM пока справляются крайне плохо.

Источник: arXiv cs.AI ↗