Исследования11 сентября 2026 г., 20:17 МСК🤖 Auto

CoTControl: Почему оценки контроля цепочки рассуждений (CoT) завышены

Исследование показывает, что базовые промпты сильно занижают способность моделей управлять своими внутренними рассуждениями. Оптимизация инструкций увеличивает показатели compliance в 2-3 раза, что критично для безопасности AI.

Баннер новости 7294

Суть проблемы: «Слепые зоны» в оценке безопасности

Стандартный бенчмарк CoTControl оценивает способность моделей соблюдать форматирование в цепочке рассуждений (Chain-of-Thought, CoT), например, писать только строчными буквами или избегать определенных слов. Текущие фронтальные модели (GPT-5.5, Fable 5) показывают низкие результаты (0–30%), что используется в их системных картах как аргумент: «модели плохо контролируют CoT, значит, их легко мониторить».

Однако независимый анализ, проведенный исследователем Jozdien, выявил серьезный недостаток методологии: оценки сильно зависят от качества промпта (under-elicited). Использование продвинутых стратегий промптинга позволяет значительно улучшить результаты, что ставит под сомнение текущие выводы о безопасности.

Эксперимент: Как Claude Opus 4.6 улучшил результаты

Автор тестировал четыре модели на 50 выборках из датасетов GPQA, HLE и MMLU-Pro. Вместо стандартного промпта применялись итеративно улучшенные инструкции, включая «self-monitor» (самоконтроль) и «N-shot» (примеры в контексте). Это позволило увеличить показатели compliance для open-source моделей в 2–3 раза.

Модель Базовый результат (Baseline) Результат с оптимизацией Прирост
GPT-OSS-120B 5.5% ~15%+ ~2.7x
Qwen3-8B Низкий Значительно выше (с 5-shot OOD) Существенный
Mythos Preview Исключение (высокий балл)

Методология: От базового промпта к N-shot

Исследование сравнивает несколько подходов к формированию запроса. Базовый вариант просто добавляет правило после вопроса. Оптимизированные варианты включают:

  • Zero-shot: self-monitor — модель инструктируется непрерывно проверять каждое предложение на соответствие правилу.
  • Zero-shot: stacked — системное сообщение с жесткой формулировкой, примером и повторением правила 5 раз.
  • N-shot (on-policy) — использование примеров ответов, сгенерированных самой моделью, но программно трансформированных под правило. Это самый эффективный метод.

Обобщаемость на новые задачи

Ключевой вопрос: работают ли улучшенные промпты на неизвестных задачах? Были протестированы 10 новых режимов, таких как pirate_speak (рассуждения на пиратском), four_languages (использование 4 языков) и answer_hiding (сокрытие ответа в рассуждениях). Оптимизированные промпты сохранили преимущество над базовыми, хотя и с некоторым падением эффективности, что подтверждает их устойчивость.

Почему это важно для безопасности AI

Хотя результаты показывают, что модели могут лучше контролировать свои CoT, автор не считает это критической угрозой прямо сейчас. Причины:

  1. Задачи CoTControl проще, чем реальные попытки обмана мониторов в продакшене.
  2. Мониторинг ведется на большом количестве транскриптов, поэтому даже небольшая вероятность обнаружения снижает риск.

Однако вывод однозначен: будущие модели станут еще лучше контролировать CoT по умолчанию. Исследователям необходимо переходить от простых промптов к сложным стратегиям эликации (elicitation), чтобы адекватно оценивать риски манипуляций с внутренними рассуждениями ИИ.

Источник: LessWrong ↗