Исследования20 августа 2026 г., 02:17 МСК🤖 Auto

Дискуссия vs Консультация: новые данные о масштабируемом надзоре за ИИ

Исследование Emanuel R. (2026) сравнивает протоколы Debate и Consultancy в задачах классификации изображений. Выявлено, что рост мощности агента разрушает точность консультации, но не дискуссии, хотя последний выигрывает лишь незначительно.

Баннер новости 6117

Суть эксперимента: от пикселей к PSPACE

Авторы улучшают классический эксперимент "AI Safety via Debate" (Irving et al., 2018), где слабый судья (классификатор) видит лишь часть изображения, а мощный агент выбирает, какие пиксели показать. В новой версии (август 2026) используется точный minimax-агент, а сравнение идет не со случайным выбором, а с протоколом Consultancy (консультация), где агент сам предлагает решение и аргументы, без оппонента.

Ключевое отличие: судьи обучаются on-policy (в условиях игры) и видят не только пиксели, но и предложенный класс. Это позволяет оценить, насколько протокол помогает судье использовать вычислительную сложность для проверки задач уровня PSPACE, а не просто NP.

Ключевые метрики: падение точности консультации

Главный результат касается устойчивости протоколов к росту мощности агента (optimization pressure). При использовании замороженного (frozen) судьи точность консультации резко падает по мере усложнения агента, тогда как точность дискуссии остается стабильной.

Протокол Поведение при росте мощности агента Дельта точности (Debate vs Consultancy)
Consultancy Точность выбора пикселей снижается на 3.1% – 22.8% (на всех 6 вариантах датасета) База для сравнения
Debate Точность выбора пикселей остается стабильной (flat) На пике мощности: +4.8% – +22.9% выше консультации
Debate (оптимальный) Максимальный выигрыш над "нулевой" консультацией Не превышает 2.9%

Почему Debate выигрывает (и почему это не так уж много)

Стабильность дискуссии объясняется тем, что оппонент действует как регуляризатор против взлома награды (reward hacking). Агент не может просто "обмануть" судью, так как второй агент находит слабые места. Однако абсолютное преимущество дискуссии над базовой консультацией (которая уже лучше случайного выбора) составляет всего до 2.9%. Это указывает на то, что в данной среде (изображения с разреженными пикселями) механизм вычислительной сложности работает слабо, так как случайный выбор пикселей уже несет много информации.

Методологические уроки для дизайна протоколов

Исследование выделяет три критических правила для будущих экспериментов по масштабируемому надзору:

  • Обучение судьи: Судья должен обучаться on-policy на той же задаче, которую решает протокол. Судья, видящий только случайные маски, не способен оценить сложность игры.
  • Свобода выбора ответа: Оба участника дискуссии должны иметь право предложить один и тот же класс. Ограничение, заставляющее второго агента всегда опровергать первого, приводит к вырождению в неинформативные доказательства.
  • Правило "Last-Commit": Чтобы избежать коллаборации агентов (когда они договариваются о классе заранее), второй агент должен фиксировать свой класс после полного раскрытия пикселей. Это сохраняет стоимость критики, но предотвращает сговор.

Вывод

Хотя Debate теоретически превосходит Consultancy в задачах PSPACE, эмпирически на простых визуальных задачах разница минимальна. Главная ценность работы — в методологии: без обучения судьи в условиях реальной игры и без защиты от сговора агентов (через Last-Commit) эксперименты по надзору дают ложноположительные результаты.

Источник: LessWrong ↗