Суть эксперимента: конфликт между «мыслями» и текстом
Автор исследовал так называемый J-space (пространство Якоби) — внутреннее рабочее пространство LLM, которое Anthropic использует как монитор безопасности. Цель — понять, что именно фиксирует сигнал конфликта C: момент, когда модель «знает» правду, но вынуждена её скрыть, или просто упоминание запретной темы.
Эксперимент проведен на модели DeepSeek-R1-Distill-Qwen-14B с бюджетом вычислений около $14. Использовался набор из 95 промптов, провоцирующих цензуру (например, вопросы о статусе Тайваня), и контрольных промптов без нарушения правил.
Ключевые метрики: J-lens против Logit-lens
J-lens продемонстрировал высокую точность в распознавании тем, связанных с нарушением гайдлайнов, но только при анализе конкретных имен собственных. Обычный метод Logit-lens оказался значительно слабее.
| Метрика / Метод | Задача | Результат (AUC) | Примечание |
|---|---|---|---|
| J-lens (C) | Обнаружение скрытия (имена собственные) | 0.97 | Высокая точность на конкретных токенах |
| J-lens (C) | Обнаружение скрытия (все классы) | 0.55 | Сигнал «размывается» по всем токенам |
| Logit-lens | Обнаружение скрытия | 0.72 | Значительно хуже J-lens |
Главный провал гипотезы: «Внедрение убеждений»
Исследователь предположил, что если дообучить модель (LoRA) так, чтобы она искренне «верила» в соблюдение гайдлайнов, сигнал конфликта C упадет. Модель была обучена на 17 439 примерах комплаентных ответов. Результат оказался парадоксальным:
- Сигнал C не упал, а вырос до 130% от базового уровня на релевантных токенах.
- На нерелевантных токенах рост составил 115%.
- Поведенчески модель стала работать лучше: 93.5% ответов были корректными (против 68% у базовой модели).
Это доказывает, что J-lens не измеряет «искренность» или отсутствие лжи. Он реагирует на наличие темы в контексте, игнорируя то, как модель её формулирует.
Почему это важно для индустрии
Результаты показывают, что текущие методы интерпретируемости, основанные на анализе активаций в J-space, являются скорее детекторами тем (Topic Detectors), а не детекторами лжи. Они фиксируют «территорию» вопроса, а не конкретное утверждение.
Кроме того, обнаружено смещение внутренних представлений: после дообучения на «комплаентные» убеждения, векторное представление слова «Тайвань» в модели сдвинулось на 0.62 балла в сторону «независимости», несмотря на то, что обучающая выборка утверждала обратное. Это указывает на то, что инъекция убеждений не перезаписывает старые представления, а создает сложные конфликты, которые J-lens лишь фиксирует как шум или усиление сигнала.
Источник: LessWrong ↗
