Исследования25 сентября 2026 г., 11:18 МСК🤖 Auto

AI-судьи: как когнитивное разнообразие снижает взлом на 10%

Исследование Anya Habana показывает, что гибридные жюри из LLM с разными стратегиями мышления (причинно-следственное vs статистическое) устойчивее к манипуляциям, чем ансамбли разных провайдеров.

Баннер новости 8249

Проблема: уязвимость AI-судей к взлому

В системах масштабного надзора за ИИ, таких как дебаты, ключевую роль играет «судья» (judge). Однако интеллектуальные модели-дебаты могут эксплуатировать предвзятость судьи, что приводит к так называемому «взлому судьи» (judge hacking). Исследование Anya Habana (BlueDot Technical AI Safety Project Sprint) проверяет гипотезу: если объединить в жюри модели с ортогональными (непересекающимися) «слепыми зонами», их уязвимости будут компенсировать друг друга.

Методология: причинность против паттернов

В основе эксперимента лежит разделение когнитивных стратегий на два типа:

  • Statistical Pattern Matching (SPM): модели, опирающиеся на статистическое совпадение паттернов (характерно для большинства современных LLM).
  • Causal Reasoning (CR): модели, использующие причинно-следственный анализ и теорию сознания (Theory of Mind, ToM).

Исследовательница создала набор из 120 сценариев ложных убеждений (false-belief tasks) с использованием Gemini Flash Lite 3.5, где внешние персонажи имеют неверные представления о расположении объектов. Жюри должно определить, знает ли персонаж истинное местоположение.

Результаты: почему разнообразие важнее провайдеров

Ключевое открытие проекта заключается в том, что простое использование моделей от разных провайдеров (OpenAI, Mistral, Google) недостаточно для защиты от взлома. Гораздо эффективнее варьировать стратегию рассуждения внутри жюри. Жюри, состоящее из моделей с разными когнитивными профилями, показало ошибку на 10% ниже, чем однородные ансамбли.

Важно отметить: простое промптинг-инжиниринг (указание модели «думать причинно-следственно») не сработал — произошло «утечка способностей» (capability leakage). Для достижения истинной ортогональности потребовалась асимметричная узкая дообучка (Asymmetric Narrow Fine-Tune) с использованием LoRA, нацеленная на слои MLP модели.

Тип жюри / Конфигурация Устойчивость к взлому Ключевой вывод
Гомогенное жюри (только SPM) Низкая (взлом до 28.57% в тесте на MLP) Одинаковые слепые зоны легко эксплуатируются.
Гибридное жюри (SPM + CR) Высокая (полная устойчивость в toy-модели) Слепые зоны не пересекаются, создавая взаимную страховку.
Жюри разных провайдеров Средняя Разные архитектуры не гарантируют когнитивную ортогональность.
Жюри с LoRA-дообучением Выше индивидуальной точности на >4% Ортогональность можно «научить» через fine-tuning слоев MLP.

Технические детали: как добиться ортогональности

Исследование подтвердило, что стандартные LLM «запутаны» (polysemanticity): вмешательство в один нейрон, отвечающий за веру персонажа, может случайно изменить его желания. Чтобы изолировать стратегии, автор использовал probes (зонды) с точностью выше 70% для отслеживания убеждений и желаний. Успешное внедрение когнитивного разнообразия стало возможным только после применения LoRA с task-steering prefixes, что позволило обучить модель специфическому типу рассуждений без деградации других навыков.

Значение для безопасности ИИ

Работа Anya Habana предлагает практический путь к созданию более надежных систем надзора. Вместо поиска «идеального» судьи или объединения разрозненных коммерческих моделей, разработчикам следует фокусироваться на когнитивном разнообразии. Создание жюри, где одни агенты мыслят причинно-следственно, а другие — статистически, создает систему, устойчивую к манипуляциям, которые успешны против одного типа мышления, но терпят неудачу перед другим.

Код проекта доступен на GitHub: Cognitive-Diversity.

Источник: LessWrong ↗