Исследования8 июля 2026 г., 10:16 МСК🤖 Auto

LLM-агенты: почему бенчмарки врут, а ошибки накапливаются

Новый синтез 27 исследований выявил 6 критических кластеров сбоев LLM-агентов. Авторы доказывают, что рост показателей в изолированных тестах не гарантирует надежности в реальных сценариях.

Баннер новости 3093

За пределами лидербордов

Исследователи Wael Albayaydh, Rui Zhao и Ivan Flechais опубликовали работу, которая ставит под сомнение текущие метрики оценки LLM-агентов. Они проанализировали 27 статей (2023–2026 гг.), охватывающих 19 различных бенчмарков, и создали единую таксономию ограничений. Главный вывод: успешное выполнение отдельных подзадач не переводится в линейный успех всей цепочки действий агента.

Шесть кластеров сбоев

Авторы классифицировали ошибки, возникающие на разных этапах конвейера «рассуждение-действие». Критически важно, что эти сбои не изолированы — они имеют тенденцию к нелинейному накоплению по мере усложнения задачи.

Кластер ошибки Суть проблемы Пример проявления
1. Инструменты Ошибки вызова и параметров Неверный синтаксис API или пропуск обязательных аргументов
2. Планирование Нарушение ограничений Игнорирование условий задачи при построении плана
3. Долгосрочное мышление Деградация от контекста Потеря ранних инструкций при накоплении истории диалога
4. Мульти-агентность Сбои координации Конфликтующие действия при взаимодействии нескольких агентов
5. Безопасность Уязвимость к атакам Выполнение вредоносных инструкций в условиях неопределенности
6. Валидация Проблемы измерений Искажение результатов из-за некорректных метрик оценки

Нелинейный рост ошибок

Ключевая статистика исследования: ошибки накапливаются не аддитивно, а экспоненциально. Если агент совершает ошибку на шаге 1, вероятность успеха на шаге 10 падает драматически. При этом исследователи отмечают прогресс в узких задачах: однократное использование инструментов, короткая навигация по веб-страницам и простые задачи по кодингу решаются успешно.

Почему это важно

Дополнительное «скаффолдинг» (внешние структуры поддержки) не всегда повышает надежность. Это означает, что просто добавление больше контекста или инструкций не решает фундаментальных проблем архитектуры агентов. Для индустрии это сигнал: нужно переходить от оценки изолированных навыков к тестированию end-to-end сценариев с длинным горизонтом планирования.

Источник: arXiv cs.AI ↗