Разрушение мифа о синергии
Новое исследование, поданное в ICLR 2027, ставит под сомнение популярный тренд на использование мультиагентных систем (Multi-Agent Debate, MAD) для улучшения рассуждений малых языковых моделей (SLM). Авторы проверили гипотезу о том, что именно когнитивное разнообразие (разные личности, температуры, модели) является драйвером улучшения результатов. Эксперимент с 23 моделями от 11 вендоров и 5500+ запусками показал: гипотеза отвергается. Разница в «интеллекте» агентов не дает дополнительного бонуса к точности.
Жесткая экономика: дебаты vs Self-Consistency
Главный вывод статьи — мультиагентные дебаты неэффективны с точки зрения затрат. При сравнении с методом самосогласования (Self-Consistency), который требует генерации большего числа ответов, дебаты проигрывают или показывают паритет, но при этом требуют значительно больше ресурсов. Дебаты увеличивают время выполнения (wall-clock time) в 1.6 раза, а стоимость токенов — в 3.4 раза по сравнению с базовыми методами ансамблирования.
| Метрика | Мультиагентные дебаты (MAD) | Self-Consistency (ансамбль) | Вывод |
|---|---|---|---|
| Точность (при наличии headroom) | +3–7 пунктов | Паритет или лучше | Дебаты не дают уникального прироста |
| Время выполнения (Wall-clock) | База | 1.6x быстрее | Дебаты медленнее |
| Стоимость токенов | База | 3.4x дешевле | Дебаты экономически невыгодны |
| Источник улучшения | Первый обмен ответами | — | Большая часть пользы — от простого голосования |
«Налог на личности» и скрытые ошибки
Авторы обнаружили, что использование специфических промптов-персон (persona prompting) снижает точность. Это явление названо «налогом на персоны» (persona tax): избыточное разнообразие ролей вредит, а максимальное разнообразие лишь частично компенсирует потери. Более того, смешанные команды из разных моделей проигрывают простому большинству голосов внутри одной модели, так как точность зависит от «силы» участников, а не от их гетерогенности.
Критически важным открытием стала техническая ошибка в предыдущих исследованиях: транскрипты дебатов часто переполняли контекстное окно серверов. Исправление этой утечки данных сместило результаты сравнения с -1.8 пункта в пользу дебетов к полному паритету, окончательно лишив MAD статуса «супер-метода».
Итог для индустрии
Результаты переформатируютreported gains (сообщаемые улучшения) в эффект простого ансамблевого сэмплирования. Авторы требуют, чтобы будущие механизмы дебатов обязательно проходили проверку на соответствие бюджету и отсутствие загрязнения данных (contamination), так как текущие преимущества иллюзорны.
Источник: arXiv cs.AI ↗
