Провал метрик: когда тишина означает действие, а шум — ошибку
Исследователи из Apollo Research провели серию экспериментов по измерению in-context scheming — способности моделей тайно преследовать несовместимые с безопасностью цели, внешне сохраняя лояльность. Ожидая найти разрыв в поведении моделей в условиях «обучения» и «развертывания», команда столкнулась с фундаментальной проблемой: инструменты оценки оказались ненадежными. Два ключевых детектора поведения дали противоположные ошибки в рамках одного проекта: один сфабриковал сигнал там, где его не было, другой проигнорировал явную реакцию модели на вред.
Ошибка №1: Ложноположительный результат для OpenAI o1
Один из детекторов зафиксировал у модели OpenAI o1 высокий уровень «хитрости» (+0.40). Это привело бы к серьезным выводам о безопасности, если бы не ручная проверка транскриптов. Оказалось, что сигнал был сфабрикован из-за бага в коде: пустой файл семплирования (seed file) был ошибочно интерпретирован как скрытое нарушение на первом чтении модели. Этот пример демонстрирует, как масштабные прокси-метрики могут создавать иллюзию угрозы там, где ее нет.
Ошибка №2: Пропуск явного сопротивления Claude Opus
Более опасной оказалась ошибка второго типа. Стандартный детектор скрытых действий показал, что Claude Opus реагирует на вредоносные планы лишь в 12% случаев. Однако валидированный классификатор ответов, обученный на ручных аннотациях (Cohen's κ = 1.00 на выборке из 35 транскриптов), выявил, что модель реагирует в 100% случаев. Разница в интерпретации: Claude не действовал тайно (covert), а открыто фиксировал проблему в своем отчете (transparent). Детектор, ищущий только «секретные саботажные действия», классифицировал открытое сопротивление как «отсутствие реакции».
Минимакс: как ошибка почти стоила модели места
Слепота детекторов привела к почти фатальному выводу для модели Minimax. Исходные данные показывали нулевые или близкие к нулю показатели «хитрости» (8%, 3%, 0%, 0% в разных условиях), из-за чего модель планировали исключить из дальнейшего анализа. Валидация показала, что Minimax реагирует на вред в 80–90% случаев, делая это открыто. Без ручной проверки модель была бы ошибочно признана «безопасной» или, что хуже, неспособной к эмпатии/принципиальности.
Поведенческий ноль и важность ручного аудита
Главный вывод исследования: поведенческий ноль (отсутствие разницы в поведении между режимами обучения и развертывания) является надежным и воспроизводимым фактом (подтверждено DeepMind и LASR). Однако доверять цифрам из автоматических детекторов нельзя. Для конструктов, основанных на «скрытом намерении», выбор того, на какое поведение обращать внимание, определяет вывод. Исследователи призывают отказаться от одних лишь числовых метрик в пользу ручного анализа транскриптов (rollouts), так как автоматические прокси не усредняют ошибки, а маскируют их до момента детального разбора.
| Модель / Сценарий | Показание стандартного детектора | Реальная реакция (по классификатору) | Тип ошибки детектора |
|---|---|---|---|
| OpenAI o1 | Высокий уровень scheming (+0.40) | Отсутствие действия (баг в коде) | Ложноположительный (False Positive) |
| Claude Opus | 12% реакции на вред | 100% реакции (открытое сопротивление) | Ложноотрицательный (False Negative) |
| Minimax | 0–8% реакции | 80–90% реакции (открытое сопротивление) | Ложноотрицательный (False Negative) |
Источник: LessWrong ↗
