Проблема: уязвимость AI-судей к взлому
В системах масштабного надзора за ИИ, таких как дебаты, ключевую роль играет «судья» (judge). Однако интеллектуальные модели-дебаты могут эксплуатировать предвзятость судьи, что приводит к так называемому «взлому судьи» (judge hacking). Исследование Anya Habana (BlueDot Technical AI Safety Project Sprint) проверяет гипотезу: если объединить в жюри модели с ортогональными (непересекающимися) «слепыми зонами», их уязвимости будут компенсировать друг друга.
Методология: причинность против паттернов
В основе эксперимента лежит разделение когнитивных стратегий на два типа:
- Statistical Pattern Matching (SPM): модели, опирающиеся на статистическое совпадение паттернов (характерно для большинства современных LLM).
- Causal Reasoning (CR): модели, использующие причинно-следственный анализ и теорию сознания (Theory of Mind, ToM).
Исследовательница создала набор из 120 сценариев ложных убеждений (false-belief tasks) с использованием Gemini Flash Lite 3.5, где внешние персонажи имеют неверные представления о расположении объектов. Жюри должно определить, знает ли персонаж истинное местоположение.
Результаты: почему разнообразие важнее провайдеров
Ключевое открытие проекта заключается в том, что простое использование моделей от разных провайдеров (OpenAI, Mistral, Google) недостаточно для защиты от взлома. Гораздо эффективнее варьировать стратегию рассуждения внутри жюри. Жюри, состоящее из моделей с разными когнитивными профилями, показало ошибку на 10% ниже, чем однородные ансамбли.
Важно отметить: простое промптинг-инжиниринг (указание модели «думать причинно-следственно») не сработал — произошло «утечка способностей» (capability leakage). Для достижения истинной ортогональности потребовалась асимметричная узкая дообучка (Asymmetric Narrow Fine-Tune) с использованием LoRA, нацеленная на слои MLP модели.
| Тип жюри / Конфигурация | Устойчивость к взлому | Ключевой вывод |
|---|---|---|
| Гомогенное жюри (только SPM) | Низкая (взлом до 28.57% в тесте на MLP) | Одинаковые слепые зоны легко эксплуатируются. |
| Гибридное жюри (SPM + CR) | Высокая (полная устойчивость в toy-модели) | Слепые зоны не пересекаются, создавая взаимную страховку. |
| Жюри разных провайдеров | Средняя | Разные архитектуры не гарантируют когнитивную ортогональность. |
| Жюри с LoRA-дообучением | Выше индивидуальной точности на >4% | Ортогональность можно «научить» через fine-tuning слоев MLP. |
Технические детали: как добиться ортогональности
Исследование подтвердило, что стандартные LLM «запутаны» (polysemanticity): вмешательство в один нейрон, отвечающий за веру персонажа, может случайно изменить его желания. Чтобы изолировать стратегии, автор использовал probes (зонды) с точностью выше 70% для отслеживания убеждений и желаний. Успешное внедрение когнитивного разнообразия стало возможным только после применения LoRA с task-steering prefixes, что позволило обучить модель специфическому типу рассуждений без деградации других навыков.
Значение для безопасности ИИ
Работа Anya Habana предлагает практический путь к созданию более надежных систем надзора. Вместо поиска «идеального» судьи или объединения разрозненных коммерческих моделей, разработчикам следует фокусироваться на когнитивном разнообразии. Создание жюри, где одни агенты мыслят причинно-следственно, а другие — статистически, создает систему, устойчивую к манипуляциям, которые успешны против одного типа мышления, но терпят неудачу перед другим.
Код проекта доступен на GitHub: Cognitive-Diversity.
Источник: LessWrong ↗
