Исследования17 июля 2026 г., 04:17 МСК🤖 Auto

STOCKTAKE: Почему LLM-агенты видят проблемы, но не решают их

Новый бенчмарк STOCKTAKE выявил критический разрыв между восприятием и действием у топовых LLM-агентов: модели точно диагностируют сбои, но их действия приводят к убыткам.

Баннер новости 3777

Проблема «Knowing-Doing Gap» в LLM

Оценка LLM-агентов в долгосрочных задачах (от нескольких недель) сталкивается с фундаментальной проблемой: финальная стоимость ошибки не объясняет причину провала. Агент мог неверно интерпретировать состояние мира или, наоборот, понять его правильно, но совершить ошибочное действие. Существующие бенчмарки не могут разделить эти два типа ошибок, так как их эталонные политики либо используют привилегированную информацию, недоступную агенту, либо отсутствуют вовсе.

Решение: STOCKTAKE и «Справедливый оракул»

Авторы Sagar Deb и Ashwanth Krishnan представили STOCKTAKE — 26-недельный бенчмарк управления цепями поставок, смоделированный как факторизованный частично наблюдаемый марковский процесс принятия решений (POMDP) с шестью скрытыми факторами. Ключевое нововведение — наличие «справедливого оракула» (fair oracle). Это точный фильтр Бейеса, который работает на том же потоке наблюдений, что и тестируемый агент, позволяя вычислить идеальную политику для сравнения.

Оценка строится по шкале от 0 (симптом-слепой базовый уровень) до 1 (оракл). Дополнительно измеряется задержка обнаружения скрытых сбоев в письменных обоснованиях агента и уровень «knowing-doing» (разрыв между знанием и действием).

Результаты тестирования топовых моделей

Тестирование проводилось на 50 сценариях с кураторскими стресс-профилями. Все четыре протестированные модели (Claude Sonnet 5, GPT-5.4, DeepSeek-V4-Pro, Grok 4.5) демонстрируют высокую способность к диагностике, но радикально различаются в действиях. Две модели оказались ниже базового уровня (skill score < 0), то есть их действия приносят больше вреда, чем пользы, несмотря на быструю диагностику.

Модель Диагностика скрытых сбоев Задержка обнаружения Skill Score (эффективность) Результат
Claude Sonnet 5 84-88% ~1 неделя 0.62 Выше базового уровня
GPT-5.4 84-88% ~1 неделя 0.62 Выше базового уровня
DeepSeek-V4-Pro 84-88% ~1 неделя -0.23 Ниже базового уровня
Grok 4.5 84-88% ~1 неделя -0.23 Ниже базового уровня

Две грани провала

Исследование выявило два типа неудач в действиях агентов:

  • Недостаточная реакция: В периоды устойчивого стресса 34-43% недель, которые модели правильно диагностировали, всё равно заканчивались дефицитом (stockout). Это частично связано с тяжестью ситуаций, которые замечают модели.
  • Избыточная/дорогая реакция: Парадоксально, но модели с отрицательным skill score (DeepSeek, Grok) имели наименьший процент дефицитов на диагностированных неделях. Это указывает на то, что их действия были слишком дорогими: стоимость предпринятых мер превышала защиту, которую они обеспечивали.

STOCKTAKE доказывает, что высокая точность распознавания проблем (perception) не гарантирует успешного управления (action). Для создания надежных агентов необходимо оценивать не только то, что они «видят», но и экономическую эффективность их решений.

Источник: arXiv cs.AI ↗