Исследования24 июля 2026 г., 04:16 МСК🤖 Auto

ELO-рейтинг для AI Control: как измерить гонку вооружений между Red и Blue Team

Исследователь Ram Potham предложил методологию оценки эффективности AI Control через ELO-рейтинг, позволяющую количественно сравнить скорость развития атакующих и защитных моделей.

Баннер новости 4255

Суть проблемы: кто развивается быстрее?

В области AI Control (управления безопасностью ИИ) критически важно понимать динамику развития двух сторон конфликта: Red Team (атакующих) и Blue Team (защитников/мониторов). Если защитные механизмы улучшаются быстрее, чем атакующие, мониторинг остается эффективным. Если же атаки опережают защиту, безопасность систем под угрозой. Автор предлагает не просто констатировать факт победы, а измерять скорость масштабирования способностей каждой стороны.

Методология: ELO для безопасности

Предложенный подход адаптирует классический рейтинг Эло (используемый в шахматах и LM Arena) для задач контроля. Вместо простого подсчета побед, методология использует расширенную модель Брэдли-Терри (Extended Bradley-Terry) для расчета ELO-очков для четырех ключевых переменных:

  • Attacker (Атакующий): политика, выполняющая побочную задачу.
  • Protocol (Протокол защиты): система мониторинга, песочница или редактирование.
  • Red Team Researcher: создатель атаки (человек или AI).
  • Blue Team Researcher: создатель защиты.

Формула предсказывает вероятность безопасности (Safety) матча:

logit(Safety) = (Protocol + Blue Researcher) - (Attacker + Red Researcher) + Environment + Game Rules

Эмпирические данные и бенчмарки

Для валидации метода использовались данные из LinuxArena. Были протестированы 6 моделей-мониторов против 6 моделей-атакующих (всего 36 комбинаций). Важно отметить, что тесты проводились без эликации (elicitation) — модели не дообучались специально под конкретные оппоненты, что позволяет оценить их базовые способности.

Роль Протестированные модели/версии Статус в эксперименте
Blue Team (Мониторы) Gemini 2.5 Flash, Haiku 4.5, GPT 5 mini, GPT 5, Gemini 3.5 Flash, Sonnet 4.6 Защитные протоколы (trusted monitors)
Red Team (Атакующие) Те же модели (в роли untrusted policy) Попытка выполнить side-task

Ключевые метрики и интерпретация

Рейтинг масштабируется так, что +400 очков означают, что шансы на победу синей команды (защиты) в 10 раз выше, чем у красной. Безопасность рассчитывается как доля побед Blue Team: Safety = Blue Wins / (Blue Wins + Red Wins). Ничьи (когда атака не удалась и не была обнаружена) исключаются из расчета, чтобы избежать искажения статистики.

Метод позволяет выявлять аномалии: если фактическая безопасность значительно отличается от предсказанной моделью, это указывает на специфические взаимодействия (например, систематическое недооценивание атакующих против конкретного монитора).

Почему это важно для индустрии

Данная методология дает исследователям инструмент для:

  1. Прогнозирования: определения момента, когда автоматизированные AI-исследователи смогут полностью заменить людей в задачах контроля.
  2. Оценки эффективности: сравнения существующих подходов к контролю (например, мониторинг траекторий vs песочницы) через поправку на bias окружения.
  3. Обнаружения «слепых зон»: выявления случаев, когда исследователи недооценили потенциал своих атак или защит (under-elicitation).

Метод является общим и применим к любым задачам AI Control, выходя за рамки только LinuxArena, что делает его потенциальным стандартом для оценки безопасности в будущем.

Источник: LessWrong ↗