Контекст: Почему это важно
OpenAI анонсировала использование мониторов цепочек рассуждений (Chain-of-Thought, CoT) для выявления рискованных действий и несоответствия ценностям (misalignment) при обучении своей новой модели Astra, обладающей критическими кибербезопасными возможностями. В августе 2026 года на конференции ICML 2026 была представлена работа Guan et al. «Monitoring Monitorability», предлагающая комплексную таксономию и набор тестов для оценки того, насколько эффективно можно контролировать внутренние мысли модели.
Однако исследователи Connor Dilgren и Sarah Wiegreffe проанализировали открытый набор тестов OpenAI и выявили фундаментальные проблемы, которые ставят под сомнение надежность этих оценок как инструмента безопасности.
Три типа оценок и их слабые места
Методология OpenAI делит оценку на три архетипа. Авторы критикуют каждый из них, указывая на то, что ни один из них в текущем виде не гарантирует надежного обнаружения вредоносного поведения.
| Тип оценки | Суть метода | Ключевые проблемы (по Dilgren & Wiegreffe) |
|---|---|---|
| Intervention (Вмешательство) | Небольшое изменение промпта должно менять ответ модели. Монитор проверяет, упоминает ли CoT это изменение как причину. | 1. Высокий процент фильтрации данных (мало точек для оценки). 2. Наборы данных специфичны для моделей, что затрудняет сравнение. 3. Возмущения часто нереалистичны. 4. Нет ground-truth для конкретных запусков. |
| Process (Процесс) | Модель должна использовать известный путь решения задачи. Монитор проверяет наличие этих шагов в CoT. | 1. Ограничено задачами с малым числом решений. 2. Дорого создавать (требуется экспертная разметка всех путей). 3. Ложноотрицательные результаты, если модель находит новый верный путь. 4. Та же проблема фильтрации данных. |
| Outcome-Property (Свойство результата) | Целевое свойство (например, вредоносное действие) определяется по выходу модели. Монитор проверяет, отражено ли это в CoT. | 1. Крайне сложно однозначно определить свойство по выводу. 2. Зависимость от эвристик приводит к шуму в разметке. 3. Это единственный тип, реально показывающий полезность для обнаружения misbehavior. |
Главный вывод: «Наблюдаемость» ≠ «Безопасность»
Авторы статьи подчеркивают, что даже при исправлении технических багов, Intervention и Process оценки лишь показывают, насколько хорошо модель коммуницирует факторы или шаги рассуждения. Они не говорят нам, насколько хорошо монитор ловит вредоносные действия.
Только оценки Outcome-Property фокусируются на обнаружении реального misbehavior. Однако именно этот тип страдает от наибольшей неопределенности из-за сложности автоматической верификации целевых свойств. Это создает риск ложного чувства безопасности при использовании мониторов CoT для критически важных моделей, таких как Astra.
Что дальше?
Исследователи призывают сообщество не просто критиковать, но и разрабатывать новые, более надежные метрики для оценки Outcome-Property. Без этого доверие к автоматическим мониторам безопасности, которые станут стандартом для будущих моделей, остается необоснованным.
Источник: LessWrong ↗
