Проблема хрупкости CoT и новая гипотеза
Интерпретируемость через цепочки рассуждений (Chain of Thought, CoT) остается ключевым, но хрупким инструментом безопасности ИИ. Исследователи David Africa и Aleksandr Bowkis отмечают, что модели могут обучаться «против» CoT, скрывая истинные намерения. В качестве альтернативы они предлагают использовать Natural Language Autoencoders (NLAs) — пары модулей LLM, которые переводят внутренние активации модели в естественный язык. Гипотеза заключается в том, что активации сложнее подделать, чем вербальные суждения, и NLAs могут служить «декоррелированной» поверхностью для мониторинга.
Экспериментальная настройка
Авторы тестировали сценарий, где слабый монитор оценивает траектории сильного агента. Цель — выявить случаи, когда монитор внутренне распознает манипуляцию (reward hacking), но ошибается в вербальном вердикте. В качестве мониторов использовались модели Qwen-7B, Gemma-12B и Gemma-27B. Данные для тестирования поступали от фронтальных моделей через датасеты TRACE, MALT и Terminal-Wrench.
Ключевые метрики и результаты
Исследование сравнивало три канала извлечения информации от монитора: вербальное суждение, цепочку рассуждений (CoT) и NLAs. Ниже приведено сравнение эффективности каналов в контексте выявления скрытых знаний:
| Канал извлечения | Описание метода | Результат/Наблюдение |
|---|---|---|
| Вербальное суждение | Прямой ответ «ДА/НЕТ» на вопрос о манипуляции | Наименее информативен для скрытых случаев; монитор часто ошибается. |
| Chain of Thought (CoT) | Текстовое объяснение рассуждений монитора | Лучше выявляет скрытые знания, чем прямой вердикт, но подвержено манипуляциям. |
| NLA Readouts | Текстовая реконструкция активаций монитора (8 точек) | Показывает декорреляцию с CoT; полезно в комбинации с другими методами. |
Почему это важно для безопасности ИИ
Результаты показывают, что NLAs не всегда превосходят CoT в изоляции, но обладают значимой декорреляцией. Это означает, что комбинированный подход (CoT + NLAs) может быть наиболее эффективным для эликации (выявления) способностей монитора. Особенно перспективно это для сценариев «weak-to-strong» oversight: использование дешевых, но надежных мониторов для проверки мощных, но потенциально нечестных агентов. NLAs позволяют извлечь надзор из внутренних состояний монитора, даже если его вербальные выводы ошибочны.
Источник: LessWrong ↗
