Исследования3 августа 2026 г., 19:17 МСК🤖 Auto

LLM-агенты провалили тест на 365 дней: MerchantBench показал разрыв с людьми

Новый бенчмарк MerchantBench оценил способность LLM-агентов вести долгосрочную стратегию в электронной коммерции. Лучшие модели набрали лишь 27,3% от результата человека.

Баннер новости 4971

Проблема краткосрочности в AI

Большинство современных бенчмарков для Large Language Model (LLM) оценивают агентов в рамках изолированных задач с немедленным результатом. Однако реальный бизнес требует Long-Term Coherence (долгосрочной связности) — способности сохранять цельность поведения на протяженных горизонтах, адаптируясь к накопленным данным. Авторы исследования из arXiv (2607.28956) представили MerchantBench — среду, специально созданную для проверки именно этой способности.

Масштаб и архитектура симуляции

MerchantBench — это не просто набор вопросов, а полноценная симуляция работы продавца в электронной коммерции. Ключевые параметры тестовой среды:

  • Временной горизонт: 365 симулированных дней.
  • Данные: 98 843 реальных записи о товарах из электронной коммерции.
  • Инструментарий: 26 инструментов для взаимодействия агента (поиск поставщиков, управление ценами, кассовыми разрывами).
  • Механика: Агенты должны управлять жизненным циклом каждого заказа, учитывая задержки обратной связи. «Верхние» события (действия поставщиков) видны сразу, а «нижние» результаты (заказы клиентов) приходят с задержкой, требуя долгосрочного планирования.

Результаты: разрыв с человеком

Исследователи провели 48 запусков, оценив 8 различных LLM под двумя разными фреймворками агентов. Результаты оказались шокирующими для индустрии: даже самые продвинутые модели демонстрируют критическую неспособность к долгосрочному стратегическому планированию.

Показатель Значение / Описание
Лучший результат LLM 27,3% от среднего показателя людей
Метрика успеха Средние чистые активы (net assets) к концу 365 дней
Количество моделей 8 различных LLM
Количество запусков 48 (8 моделей × 2 фреймворка)
Основная проблема Неспособность адаптировать решения на основе кумулятивных эффектов

Почему это важно

Результаты MerchantBench указывают на фундаментальный пробел в текущих архитектурах AI. Современные LLM-агенты отлично справляются с тактическими задачами, но проваливаются, когда требуется учитывать отложенные последствия решений. Для бизнеса это означает, что автоматизация сложных цепочек поставок и ценообразования пока требует значительного человеческого контроля. Исследование подчеркивает необходимость разработки новых методов обучения, ориентированных не на мгновенную награду, а на долгосрочную устойчивость стратегии.

Источник: arXiv cs.AI ↗