Суть эксперимента: LLM против теории игр
Исследователи Чэнь Лян и Фашэн Сюй провели масштабный аудит автономных агентов на базе LLM в сценарии цепочки поставок. Задача была классической: покупатель с приватной информацией о спросе торгуется с продавцом, не имеющим этой информации, по контракту «количество-цена». В качестве эталона использовалось равновесие совершенного байесовского равновесия (Perfect Bayesian Equilibrium). Всего было проведено 9 840 переговоров между моделями от OpenAI, Google и Alibaba.
Цена медлительности: 21-34% упущенной выгоды
Главный вывод: способность создавать ценность напрямую зависит от «интеллекта» модели, но способность её удерживать — от скорости. Агенты достигают соглашения в 98,9% случаев и захватывают 95,4% максимально возможной прибыли (first-best surplus). Однако они тратят в среднем 2,98 раунда переговоров, тогда как теоретический оптимум — 1,25 раунда. Каждая лишняя минута или раунд «съедает» от 21% до 34% потенциальной прибыли из-за дисконтирования стоимости.
Надежность: где нужен человеческий контроль
Базовые модели демонстрируют критическую ненадежность: в 19,2% случаев они соглашаются на контракты, которые заведомо убыточны для их стороны (индивидуально неразумные контракты). Для моделей среднего и флагманского уровня этот показатель падает до 0,0–0,6%. Это означает, что для бюджетных LLM автоматическая проверка финансовой целесообразности контракта остается обязательным «предохранителем».
Бренд важнее интеллекта: кривая Qwen
Парадоксально, но принадлежность к провайдеру (Vendor Identity) влияет на распределение прибыли сильнее, чем ранг модели. В сценарии «покупатель-покупатель» (self-play) доля захвата прибыли варьируется:
- OpenAI: 40%
- Google: 50%
- Alibaba (Qwen): 70%
Промпт как стратегический рычаг
Исследование выявило, что делегирование разделяет экономическую терпение принципала (компании) и стратегическое терпение агента. Настройка промпта для имитации «стратегического терпения» объясняет 90% дисперсии в распределении прибыли. Это делает промпт-инжиниринг не просто технической деталью, а ключевым финансовым инструментом.
| Метрика | Результат LLM-агентов | Теоретический эталон (PBE) | Комментарий |
|---|---|---|---|
| Доля соглашений | 98,9% | — | Высокая надежность достижения сделки |
| Захват сверхприбыли | 95,4% | 100% | Потери связаны с длительностью переговоров |
| Среднее число раундов | 2,98 | 1,25 | Замедление снижает прибыль на 21-34% |
| Убыточные контракты (базовые) | 19,2% | 0% | Критический риск для автоматизации |
| Убыточные контракты (флагманы) | 0,0–0,6% | 0% | Допустимый уровень риска |
Источник: arXiv cs.AI ↗
