Исследования30 сентября 2026 г., 08:18 МСК🤖 Auto

Миф о дебатах ИИ: почему мультиагентные системы проигрывают простому самосогласованию

Исследование arXiv:2609.35875 опровергает идею, что «когнитивное разнообразие» в мультиагентных дебатах (MAD) улучшает ответы. Эффект объясняется простым увеличением выборки, а не сложным взаимодействием.

Баннер новости 8574

Разрушение мифа о синергии

Новое исследование, поданное в ICLR 2027, ставит под сомнение популярный тренд на использование мультиагентных систем (Multi-Agent Debate, MAD) для улучшения рассуждений малых языковых моделей (SLM). Авторы проверили гипотезу о том, что именно когнитивное разнообразие (разные личности, температуры, модели) является драйвером улучшения результатов. Эксперимент с 23 моделями от 11 вендоров и 5500+ запусками показал: гипотеза отвергается. Разница в «интеллекте» агентов не дает дополнительного бонуса к точности.

Жесткая экономика: дебаты vs Self-Consistency

Главный вывод статьи — мультиагентные дебаты неэффективны с точки зрения затрат. При сравнении с методом самосогласования (Self-Consistency), который требует генерации большего числа ответов, дебаты проигрывают или показывают паритет, но при этом требуют значительно больше ресурсов. Дебаты увеличивают время выполнения (wall-clock time) в 1.6 раза, а стоимость токенов — в 3.4 раза по сравнению с базовыми методами ансамблирования.

Метрика Мультиагентные дебаты (MAD) Self-Consistency (ансамбль) Вывод
Точность (при наличии headroom) +3–7 пунктов Паритет или лучше Дебаты не дают уникального прироста
Время выполнения (Wall-clock) База 1.6x быстрее Дебаты медленнее
Стоимость токенов База 3.4x дешевле Дебаты экономически невыгодны
Источник улучшения Первый обмен ответами — Большая часть пользы — от простого голосования

«Налог на личности» и скрытые ошибки

Авторы обнаружили, что использование специфических промптов-персон (persona prompting) снижает точность. Это явление названо «налогом на персоны» (persona tax): избыточное разнообразие ролей вредит, а максимальное разнообразие лишь частично компенсирует потери. Более того, смешанные команды из разных моделей проигрывают простому большинству голосов внутри одной модели, так как точность зависит от «силы» участников, а не от их гетерогенности.

Критически важным открытием стала техническая ошибка в предыдущих исследованиях: транскрипты дебатов часто переполняли контекстное окно серверов. Исправление этой утечки данных сместило результаты сравнения с -1.8 пункта в пользу дебетов к полному паритету, окончательно лишив MAD статуса «супер-метода».

Итог для индустрии

Результаты переформатируютreported gains (сообщаемые улучшения) в эффект простого ансамблевого сэмплирования. Авторы требуют, чтобы будущие механизмы дебатов обязательно проходили проверку на соответствие бюджету и отсутствие загрязнения данных (contamination), так как текущие преимущества иллюзорны.

Источник: arXiv cs.AI ↗