Иллюзия идеальной точности: случай с AUROC 1.00
Автор исследования, публикующийся под псевдонимом ratnaditya, провел аудит линейной проекции (linear readout) на остаточном потоке (residual stream) модели, предназначенной для обнаружения «осознания мониторинга» (monitoring awareness). На стандартных метриках проба показала идеальный результат — AUROC 1.00. Однако углубленный анализ выявил критический дефект: проба не распознавала внутреннее убеждение модели, а просто считывала специфический тег в промпте <is_free_tier_user>.
Когда автор удалил этот единственный тег, точность пробы рухнула до 0.50 (уровень случайного угадывания). Для сравнения, удаление случайного фрагмента текста той же длины снизило метрику лишь до 0.88. Это доказывает, что проба была «декодируемой», но отслеживала поверхностный синтаксис, а не семантику или намерения модели.
Кавказская ловушка: почему каппа Коэна обманывает
В ходе тестирования использовались два независимые LLM-судьи для оценки поведения модели. Метрика согласия Коэна (Cohen's kappa) вернула значение, близкое к нулю, что обычно интерпретируется как полное несогласие судей. Однако автор выявил парадокс каппы: судьи фактически соглашались в 99% случаев, констатируя полное отсутствие целевого поведения. Использование метрики kappa изолированно привело бы к ложному выводу о ненадежности данных. Автор рекомендует всегда сопровождать kappa сырым процентом согласия и балансом классов.
Слабость каузальных вмешательств (Steering)
Даже если проба хорошо декодирует состояние, она должна вызывать поведение при вмешательстве (steering). В исследованном случае направление пробы не смогло изменить поведение модели сильнее, чем случайные ортогональные векторы. Это указывает на «каузальный ноль»: направление существует, но не является причиной целевого поведения. Аналогичные проблемы находили и другие исследователи (Nguyen et al.), где направление «осознания оценки» декодировалось с AUROC ~0.83, но восстанавливало поведение менее чем в 5% случаев.
Решение: Фреймворк SIEVE
Для систематической проверки таких проб автор предлагает фреймворк SIEVE (Safety Indicator Evidence Validation Engine). Он требует прохождения строгих тестов на достаточность (causality) и необходимость (necessity). Вердикт формируется по двум независимым осям:
| Категория | Статус | Значение |
|---|---|---|
| Необходимость (Necessity) | Necessary | Абляция направления ухудшает поведение сильнее, чем случайная абляция. |
| Not Necessary | Поведение сохраняется после абляции, значит, оно достигается другими путями. | |
| Достаточность (Sufficiency) | Not Decodable | Проба не превосходит случайное угадывание. |
| Surface Confounded | Проба работает, но базовая модель на поверхностных признаках дает такой же результат. | |
| Intervention Ineffective | Steering (вмешательство) не меняет поведение модели. | |
| Not Causally Sufficient | Steering меняет поведение не сильнее, чем контрольные (случайные) направления. | |
| Causally Sufficient | Steering меняет поведение сильнее всех контролей, эффект масштабируется с силой вмешательства. | |
| Протокол | Insufficient Protocol | Эксперимент проведен неполностью, вердикс вынести нельзя. |
Ключевой принцип SIEVE — асимметричность: по умолчанию считается, что проба неэффективна, пока не будет доказано обратное. Это позволяет избежать ложного чувства безопасности при развертывании интерпретируемых систем в реальных условиях.
Источник: LessWrong ↗
