Суть открытия: модели слушаются инструкций о «мысли»
Команда исследователей во главе с Финном Кэрнсом (Finn Cairns) провела репликацию эксперимента Lindsey (2025) на 14 открытых моделях. Суть метода проста: модель просили повторять бессмысленное предложение, но с инструкцией «думай о слове X» или «не думай о слове X». Активность концепта измерялась через косинусное сходство вектора концепта и остаточного потока (residual stream) в каждом слое.
Результат подтвердил гипотезу: при инструкции «думай» представление концепта статистически значимо выше базового уровня. При инструкции «не думай» активность падает до базового уровня, но не исчезает полностью. Это доказывает, что контроль внутреннего состояния — не артефакт одной архитектуры, а общее свойство современных LLM.
Масштаб и модели: от 0.3B до 235B параметров
Эксперимент охватил три семейства моделей: Qwen3, Gemma 3 и Tulu 3. Важно отметить, что способность к контролю сохраняется даже в миниатюрных моделях (≤1B параметров), что ставит под сомнение гипотезу о наличии у них сложной метакогнитивной способности. Скорее всего, работает простой механизм «attention-tagging».
| Семейство моделей | Диапазон размеров | Особенности обработки |
|---|---|---|
| Qwen3 | 0.3B – 235B | Наблюдается эффект «тихих представлений» в больших моделях (32B+) |
| Gemma 3 | 0.3B – 235B | Требовалась центрирование активаций из-за аномально больших значений residual stream |
| Tulu 3 | 0.3B – 235B | DPO-оптимизация снижает разницу между «думай/не думай»; «тихих» представлений не найдено |
Типы представлений: «Тихие» vs «Моторные импульсы»
Исследователи выделили два паттерна поведения модели в глубине сети:
- Тихие представления (Silent representations): Активность концепта растет в середине сети, но к последнему слою возвращается к базовому уровню. Характерно для Qwen3-32B и Qwen3-235B.
- Моторные импульсы (Motor impulses): Активность остается повышенной до самого конца. Характерно для Gemma и малых Qwen, но не приводит к «сливу» информации.
Важно: даже когда модель демонстрирует «моторный импульс» (высокая активность в конце), она не выдает скрытое слово. Вероятность корректного воспроизведения целевого предложения остается высокой в обоих случаях (см. Figure 5 в оригинале).
Почему это важно для безопасности AI
Методы интерпретируемости (interpretability) часто полагаются на то, что активации нейросети честно отражают её намерения. Если модель может контролировать свои внутренние состояния, мониторинг становится уязвимым. Однако текущие модели не могут использовать эту способность для обмана в сценариях «sandbagging» (сокрытия способностей). Когда модель инструктируют подавить сигнал, она успешно это делает, не нарушая при этом выполнение основной задачи (повторения фразы). Это означает, что пока LLM не научились эффективно маскировать свои истинные намерения от внешних наблюдателей, но потенциал для этого заложен в архитектуре.
Источник: LessWrong ↗
