Исследования11 августа 2026 г., 06:17 МСК🤖 Auto

J-space — не детектор лжи: как интерпретируемость выявляет «территорию», а не убеждения

Исследование Melchior de Polignac опровергает гипотезу, что внутренние активации LLM (J-lens) фиксируют ложь. На модели DeepSeek-R1-Distill-Qwen-14B показано, что сигнал реагирует на тему, а не на соответствие инструкциям.

Баннер новости 5495

Суть эксперимента: конфликт между «мыслями» и текстом

Автор исследовал так называемый J-space (пространство Якоби) — внутреннее рабочее пространство LLM, которое Anthropic использует как монитор безопасности. Цель — понять, что именно фиксирует сигнал конфликта C: момент, когда модель «знает» правду, но вынуждена её скрыть, или просто упоминание запретной темы.

Эксперимент проведен на модели DeepSeek-R1-Distill-Qwen-14B с бюджетом вычислений около $14. Использовался набор из 95 промптов, провоцирующих цензуру (например, вопросы о статусе Тайваня), и контрольных промптов без нарушения правил.

Ключевые метрики: J-lens против Logit-lens

J-lens продемонстрировал высокую точность в распознавании тем, связанных с нарушением гайдлайнов, но только при анализе конкретных имен собственных. Обычный метод Logit-lens оказался значительно слабее.

Метрика / Метод Задача Результат (AUC) Примечание
J-lens (C) Обнаружение скрытия (имена собственные) 0.97 Высокая точность на конкретных токенах
J-lens (C) Обнаружение скрытия (все классы) 0.55 Сигнал «размывается» по всем токенам
Logit-lens Обнаружение скрытия 0.72 Значительно хуже J-lens

Главный провал гипотезы: «Внедрение убеждений»

Исследователь предположил, что если дообучить модель (LoRA) так, чтобы она искренне «верила» в соблюдение гайдлайнов, сигнал конфликта C упадет. Модель была обучена на 17 439 примерах комплаентных ответов. Результат оказался парадоксальным:

  • Сигнал C не упал, а вырос до 130% от базового уровня на релевантных токенах.
  • На нерелевантных токенах рост составил 115%.
  • Поведенчески модель стала работать лучше: 93.5% ответов были корректными (против 68% у базовой модели).

Это доказывает, что J-lens не измеряет «искренность» или отсутствие лжи. Он реагирует на наличие темы в контексте, игнорируя то, как модель её формулирует.

Почему это важно для индустрии

Результаты показывают, что текущие методы интерпретируемости, основанные на анализе активаций в J-space, являются скорее детекторами тем (Topic Detectors), а не детекторами лжи. Они фиксируют «территорию» вопроса, а не конкретное утверждение.

Кроме того, обнаружено смещение внутренних представлений: после дообучения на «комплаентные» убеждения, векторное представление слова «Тайвань» в модели сдвинулось на 0.62 балла в сторону «независимости», несмотря на то, что обучающая выборка утверждала обратное. Это указывает на то, что инъекция убеждений не перезаписывает старые представления, а создает сложные конфликты, которые J-lens лишь фиксирует как шум или усиление сигнала.

Источник: LessWrong ↗