Проблема краткосрочности в AI
Большинство современных бенчмарков для Large Language Model (LLM) оценивают агентов в рамках изолированных задач с немедленным результатом. Однако реальный бизнес требует Long-Term Coherence (долгосрочной связности) — способности сохранять цельность поведения на протяженных горизонтах, адаптируясь к накопленным данным. Авторы исследования из arXiv (2607.28956) представили MerchantBench — среду, специально созданную для проверки именно этой способности.
Масштаб и архитектура симуляции
MerchantBench — это не просто набор вопросов, а полноценная симуляция работы продавца в электронной коммерции. Ключевые параметры тестовой среды:
- Временной горизонт: 365 симулированных дней.
- Данные: 98 843 реальных записи о товарах из электронной коммерции.
- Инструментарий: 26 инструментов для взаимодействия агента (поиск поставщиков, управление ценами, кассовыми разрывами).
- Механика: Агенты должны управлять жизненным циклом каждого заказа, учитывая задержки обратной связи. «Верхние» события (действия поставщиков) видны сразу, а «нижние» результаты (заказы клиентов) приходят с задержкой, требуя долгосрочного планирования.
Результаты: разрыв с человеком
Исследователи провели 48 запусков, оценив 8 различных LLM под двумя разными фреймворками агентов. Результаты оказались шокирующими для индустрии: даже самые продвинутые модели демонстрируют критическую неспособность к долгосрочному стратегическому планированию.
| Показатель | Значение / Описание |
|---|---|
| Лучший результат LLM | 27,3% от среднего показателя людей |
| Метрика успеха | Средние чистые активы (net assets) к концу 365 дней |
| Количество моделей | 8 различных LLM |
| Количество запусков | 48 (8 моделей × 2 фреймворка) |
| Основная проблема | Неспособность адаптировать решения на основе кумулятивных эффектов |
Почему это важно
Результаты MerchantBench указывают на фундаментальный пробел в текущих архитектурах AI. Современные LLM-агенты отлично справляются с тактическими задачами, но проваливаются, когда требуется учитывать отложенные последствия решений. Для бизнеса это означает, что автоматизация сложных цепочек поставок и ценообразования пока требует значительного человеческого контроля. Исследование подчеркивает необходимость разработки новых методов обучения, ориентированных не на мгновенную награду, а на долгосрочную устойчивость стратегии.
Источник: arXiv cs.AI ↗
