Исследования11 августа 2026 г., 10:17 МСК🤖 Auto

LLM-агенты в переговорах: 21% потерь и зависимость от бренда

Исследование 9840 переговоров показало: LLM создают 95% ценности, но теряют её из-за медлительности. Выбор провайдера важнее интеллекта модели.

Баннер новости 5505

Суть эксперимента: LLM против теории игр

Исследователи Чэнь Лян и Фашэн Сюй провели масштабный аудит автономных агентов на базе LLM в сценарии цепочки поставок. Задача была классической: покупатель с приватной информацией о спросе торгуется с продавцом, не имеющим этой информации, по контракту «количество-цена». В качестве эталона использовалось равновесие совершенного байесовского равновесия (Perfect Bayesian Equilibrium). Всего было проведено 9 840 переговоров между моделями от OpenAI, Google и Alibaba.

Цена медлительности: 21-34% упущенной выгоды

Главный вывод: способность создавать ценность напрямую зависит от «интеллекта» модели, но способность её удерживать — от скорости. Агенты достигают соглашения в 98,9% случаев и захватывают 95,4% максимально возможной прибыли (first-best surplus). Однако они тратят в среднем 2,98 раунда переговоров, тогда как теоретический оптимум — 1,25 раунда. Каждая лишняя минута или раунд «съедает» от 21% до 34% потенциальной прибыли из-за дисконтирования стоимости.

Надежность: где нужен человеческий контроль

Базовые модели демонстрируют критическую ненадежность: в 19,2% случаев они соглашаются на контракты, которые заведомо убыточны для их стороны (индивидуально неразумные контракты). Для моделей среднего и флагманского уровня этот показатель падает до 0,0–0,6%. Это означает, что для бюджетных LLM автоматическая проверка финансовой целесообразности контракта остается обязательным «предохранителем».

Бренд важнее интеллекта: кривая Qwen

Парадоксально, но принадлежность к провайдеру (Vendor Identity) влияет на распределение прибыли сильнее, чем ранг модели. В сценарии «покупатель-покупатель» (self-play) доля захвата прибыли варьируется:

  • OpenAI: 40%
  • Google: 50%
  • Alibaba (Qwen): 70%
Этот порядок сохраняется даже при ограниченной коммуникации. Более того, смена провайдера продавца сдвигает распределение прибыли на 7–18 процентных пунктов. Флагманская Qwen, несмотря на высочайшую способность, оказалась самым слабым продавцом в кросс-семейственных переговорах.

Промпт как стратегический рычаг

Исследование выявило, что делегирование разделяет экономическую терпение принципала (компании) и стратегическое терпение агента. Настройка промпта для имитации «стратегического терпения» объясняет 90% дисперсии в распределении прибыли. Это делает промпт-инжиниринг не просто технической деталью, а ключевым финансовым инструментом.

Метрика Результат LLM-агентов Теоретический эталон (PBE) Комментарий
Доля соглашений 98,9% Высокая надежность достижения сделки
Захват сверхприбыли 95,4% 100% Потери связаны с длительностью переговоров
Среднее число раундов 2,98 1,25 Замедление снижает прибыль на 21-34%
Убыточные контракты (базовые) 19,2% 0% Критический риск для автоматизации
Убыточные контракты (флагманы) 0,0–0,6% 0% Допустимый уровень риска

Источник: arXiv cs.AI ↗