Исследования1 августа 2026 г., 00:16 МСК🤖 Auto

Анализ AI-торгов: почему ИИ не могут договориться без «механистических» объяснений

Исследователь Энтони ДиДжованни из LessWrong разбирает фундаментальные ошибки в моделях AI-баража, предлагая заменить абстрактные равновесия Нэша на механистические объяснения поведения программ.

Баннер новости 4843

Проблема «табуированного равновесия»

В статье, опубликованной 31 июля 2026 года, Энтони ДиДжованни утверждает, что текущие фреймворки для исследования AI-баража (переговоров между агентами) содержат серьезные концептуальные ошибки. Основная проблема заключается в том, что исследователи часто полагаются на абстрактные понятия, такие как «равновесие Нэша» или эвристики о том, что считается «эксплуататорским», вместо того чтобы анализировать конкретные механизмы принятия решений.

Автор предлагает перейти к механистическим объяснениям (mechanistic explanations). Это означает, что вместо вопроса «что произойдет в равновесии?» нужно спрашивать: «Какие именно убеждения и процедуры выбора программ приводят к координации или её срыву?» Это критически важно для разработки Безопасных Парето-улучшений (SPI) — одного из самых перспективных методов предотвращения конфликтов между мощными ИИ.

Три сценария сбоев координации

ДиДжованни разбирает три гипотетических сценария, в которых два продвинутых ИИ-агента (назовем их Алиса и Боб) не могут согласовать требования, несмотря на возможность создавать достоверные условные обязательства (через код/программы). Ключевая идея: каждый агент имеет стимул «обмануть» стратегию другого, добавляя в свой код условия, выгодные ему, но вредные для координации.

Стратегия координации Механизм действия Почему это терпит неудачу (Стимул к отклонению)
1. Ожидание (Waiting) Боб сначала считывает программу Алисы с доверенного сервера, затем выбирает свою стратегию. Алиса встраивает в код условие: «Если Боб заглянул на сервер, требуй больше ресурсов». Боб, зная это, предпочитает не смотреть, рискуя конфликтом, но получая лучшую долю при успехе.
2. Условные требования (Conditional Demands) Боб выбирает программу, которая снижает требования, если видит несовместимость с Алисой. Алиса встраивает условие: «Если Боб проверяет совместимость, требуй больше, чем обычно». Бобу становится невыгодно использовать такую проверку.
3. Акаузальная координация Агенты используют схожие процедуры принятия решений, предполагая, что их выбор влияет на выбор другого. Требует высокой степени сходства процедур. Если агенты не уверены в идентичности «решателя», они могут выбрать более агрессивную стратегию для защиты от риска.

Почему «Ex post optimal» ≠ «Ex ante optimal»

Центральный парадокс, который часто упускают: то, что кажется оптимальным после того, как ты узнал требования оппонента, не является оптимальным до того, как ты сделал свое обязательство. Если агент будет ждать, чтобы устранить неопределенность, он потеряет возможность повлиять на bargain (переговоры) своим первым ходом. Это создает динамическое напряжение, где «умное» поведение (адаптация к оппоненту) парадоксальным образом ведет к конфликту.

Новый фреймворк для исследований

Автор призывает отказаться от поиска универсального «равновесия» в пользу детального моделирования:

  • Убеждения об оппоненте: Что именно ИИ думает о том, как другой ИИ будет интерпретировать его код?
  • Ожидаемые последствия обязательств: Вместо эвристик «справедливости», нужно четко прописывать, какие обязательства агенты считают имеющими хорошие последствия для всех сторон.

Этот подход позволяет исследователям лучше понимать, когда агенты будут предпочитать использовать SPI (Safe Pareto Improvements), и как спроектировать системы, где такие улучшения становятся естественным исходом, а не исключением.

Источник: LessWrong ↗