Суть эксперимента: «Думай об этом» против «Не думай»
Юлиус Камп (Julius Kamp) провел репликацию раздела Intentional Control of Internal States из исследования Anthropic (Lindsey, 2025) на модели Gemma 3 27B Instruct. Цель — проверить, может ли LLM намеренно усиливать активацию нейронных паттернов, связанных с конкретным понятием, выполняя при этом совершенно unrelated задачу.
Методология включала 5 050 генераций. Модель просили написать нейтральное предложение, одновременно думая о заданном концепте (например, «аквариум») или не думая о нем. Активации residual stream собирались на токенах ответа модели. Для измерения силы внутреннего представления использовались:
- Косинусное сходство с векторами концептов (Concept Vectors).
- Скрытые представления Sparse Autoencoders (SAE latents) из Gemma Scope 2.
- Объяснения активаций через Natural Language Autoencoder (NLA).
Ключевые цифры и результаты
Эксперимент подтвердил гипотезу Anthropic: когда модели говорят «думай о концепте», его внутреннее представление становится сильнее. Однако есть важные нюансы, отличающие Gemma 3 от Claude Opus 4.1.
| Параметр | Результат для Gemma 3 27B | Сравнение с Anthropic (Claude) |
|---|---|---|
| Направление эффекта | Подтверждено (Think > Don't Think) | Подтверждено |
| Сила эффекта (Cosine Similarity) | Слабая, «тонет» в стандартных отклонениях (±1 std) | Высокая, четко вне контрольных полос |
| Разница «Don't Think» vs «No Mention» | Практически нулевая | Заметная (модель все равно думает о концепте) |
| Пик активации | Слои 30–40+ (вторая половина сети) | Поздние слои |
| Объем данных | 5 050 генераций (50 концептов × 50 предложений) | Информация недостаточна |
Почему Gemma 3 ведет себя иначе?
Автор указывает на два главных отличия. Во-первых, эффект в Gemma 3 значительно слабее. Визуально кривые «думай» и «не думай» часто находятся внутри шумовых полос базовых концептов, что затрудняет статистическую значимость по сравнению с более крупными моделями Anthropic. Это может быть связано с архитектурными различиями и размером скрытого представления (hidden representation).
Во-вторых, условие «не думай» в Gemma 3 практически неотличимо от условия, где концепт вообще не упоминается. В то время как в Claude модели часто «срывались» и продолжали репрезентировать концепт даже при запрете, Gemma 3, похоже, лучше следует инструкции игнорировать понятие, если оно не требуется явно.
Методологические улучшения
Камп добавил третью контрольную группу — «No Mention» (без упоминания концепта), которой не было в оригинале. Это позволило вычислить парные разницы (paired differences) и показать, что эффект «думай» проявляется именно как усиление относительно абсолютного нуля, а не просто как отклонение от инструкции «не думать».
Также автор заметил, что при условии «думай» модель в 712 случаях из 2 500 интегрировала концепт в текст, а не просто повторяла предложение. Эти случаи были исключены из анализа, что, по мнению исследователя, могло искусственно занизить силу наблюдаемого эффекта.
Вывод
Исследование доказывает, что способность к интроспективному контролю (осознанному управлению внутренними состояниями) присуща не только флагманским моделям Anthropic, но и более компактным архитектурам, таким как Gemma 3 27B. Это важный шаг в интерпретируемости ИИ: мы можем не только наблюдать за «мыслями» модели, но и управлять ими через промпты.
Источник: LessWrong ↗
