Исследования30 июля 2026 г., 03:17 МСК🤖 Auto

Gemma 3 27B: Интенциональный контроль мыслей модели

Исследователь Юлиус Камп воспроизвел эксперимент Anthropic на Gemma 3 27B, доказав, что модель может усиливать внутреннее представление концепции по команде, даже если пишет о другом.

Баннер новости 4679

Суть эксперимента: «Думай об этом» против «Не думай»

Юлиус Камп (Julius Kamp) провел репликацию раздела Intentional Control of Internal States из исследования Anthropic (Lindsey, 2025) на модели Gemma 3 27B Instruct. Цель — проверить, может ли LLM намеренно усиливать активацию нейронных паттернов, связанных с конкретным понятием, выполняя при этом совершенно unrelated задачу.

Методология включала 5 050 генераций. Модель просили написать нейтральное предложение, одновременно думая о заданном концепте (например, «аквариум») или не думая о нем. Активации residual stream собирались на токенах ответа модели. Для измерения силы внутреннего представления использовались:

  • Косинусное сходство с векторами концептов (Concept Vectors).
  • Скрытые представления Sparse Autoencoders (SAE latents) из Gemma Scope 2.
  • Объяснения активаций через Natural Language Autoencoder (NLA).

Ключевые цифры и результаты

Эксперимент подтвердил гипотезу Anthropic: когда модели говорят «думай о концепте», его внутреннее представление становится сильнее. Однако есть важные нюансы, отличающие Gemma 3 от Claude Opus 4.1.

Параметр Результат для Gemma 3 27B Сравнение с Anthropic (Claude)
Направление эффекта Подтверждено (Think > Don't Think) Подтверждено
Сила эффекта (Cosine Similarity) Слабая, «тонет» в стандартных отклонениях (±1 std) Высокая, четко вне контрольных полос
Разница «Don't Think» vs «No Mention» Практически нулевая Заметная (модель все равно думает о концепте)
Пик активации Слои 30–40+ (вторая половина сети) Поздние слои
Объем данных 5 050 генераций (50 концептов × 50 предложений) Информация недостаточна

Почему Gemma 3 ведет себя иначе?

Автор указывает на два главных отличия. Во-первых, эффект в Gemma 3 значительно слабее. Визуально кривые «думай» и «не думай» часто находятся внутри шумовых полос базовых концептов, что затрудняет статистическую значимость по сравнению с более крупными моделями Anthropic. Это может быть связано с архитектурными различиями и размером скрытого представления (hidden representation).

Во-вторых, условие «не думай» в Gemma 3 практически неотличимо от условия, где концепт вообще не упоминается. В то время как в Claude модели часто «срывались» и продолжали репрезентировать концепт даже при запрете, Gemma 3, похоже, лучше следует инструкции игнорировать понятие, если оно не требуется явно.

Методологические улучшения

Камп добавил третью контрольную группу — «No Mention» (без упоминания концепта), которой не было в оригинале. Это позволило вычислить парные разницы (paired differences) и показать, что эффект «думай» проявляется именно как усиление относительно абсолютного нуля, а не просто как отклонение от инструкции «не думать».

Также автор заметил, что при условии «думай» модель в 712 случаях из 2 500 интегрировала концепт в текст, а не просто повторяла предложение. Эти случаи были исключены из анализа, что, по мнению исследователя, могло искусственно занизить силу наблюдаемого эффекта.

Вывод

Исследование доказывает, что способность к интроспективному контролю (осознанному управлению внутренними состояниями) присуща не только флагманским моделям Anthropic, но и более компактным архитектурам, таким как Gemma 3 27B. Это важный шаг в интерпретируемости ИИ: мы можем не только наблюдать за «мыслями» модели, но и управлять ими через промпты.

Источник: LessWrong ↗