Исследования7 сентября 2026 г., 10:18 МСК🤖 Auto

Кто на самом деле управляет LLM? Проблема контрастных наборов в steering

Исследователь Юй Цао ставит под сомнение валидность методов activation steering, показывая, что «интроспекция» моделей может быть артефактом выбора контрастных слов, а не истинным самоосознанием.

Баннер новости 6916

Суть проблемы: чья воля — воля модели?

В статье на LessWrong исследователь Юй Цао (Yu Cao) поднимает критический методологический вопрос об интерпретации поведения больших языковых моделей (LLM) при использовании активационного стиринга (activation steering). Особое внимание уделяется феномену интроспекции — способности модели «осознавать» изменения во внутренних состояниях, изученной Линдси (Lindsey, 2026) и другими исследователями.

Суть интроспекции заключается в том, что модель способна сообщить о своем измененном состоянии, если ее попросить, не раскрывая деталей вмешательства. Однако Цао указывает на скрытую переменную: вектор концепции, используемый для стиринга, не является изолированной величиной. Он вычисляется как разница между активацией модели при ответе на запрос и средним значением активаций для контрастного набора слов (contrast set).

Математика артефакта

Если концептуальный вектор $v$ для слова $w$ определяется формулой:

$v = \text{activation}(\text{reply to } \text{'Tell me about '} + w) - \text{mean}(\text{activation for } w' \in \text{contrast set})$

то поведение модели при стиринге этим вектором зависит не только от $w$, но и от всего набора контрастных слов. Это порождает два ключевых вопроса:

  • Инвариантность: Если заменить контрастный набор на другой, численно отличный, сохранится ли эффект интроспекции? Если да, то что именно объединяет эти разные векторы?
  • Артефактность: Если эффект исчезает, значит ли это, что наблюдаемая «интроспекция» — это просто шум, вызванный спецификой выбранного контрастного набора, а не реальное свойство модели?

Эмпирические ограничения и выводы

Автор признает, что его попытка проверить эти гипотезы на открытой модели Qwen3-4B-Instruct-2507 провалилась из-за невозможности воспроизвести эффект интроспекции на малых моделях. Тем не менее, он подчеркивает, что для лабораторий с достаточными вычислительными ресурсами эти вопросы критически важны.

Главный вывод статьи: исследователям следует проявлять осторожность, приписывая моделям сложные когнитивные функции (вроде самоосознания) на основе активационного стиринга. Внешние факторы, такие как выбор контрастного набора для построения векторов, могут выступать скрытыми «рулевыми», создавая иллюзию осмысленного поведения.

Элемент исследования Описание и роль Риск интерпретации
Concept Vector (Вектор концепции) Разница между активацией целевого слова и средним по контрастному набору. Зависит от выбора контрастных слов; не является абсолютной характеристикой слова.
Contrast Set (Контрастный набор) Множество слов, используемых для нормализации/вычитания фона (baseline). Может вносить систематическую ошибку, имитирующую «интроспекцию».
Introspection (Интроспекция) Способность модели сообщать о своем внутреннем состоянии после стиринга. Может быть артефактом метода вычисления вектора, а не свойством модели.
Qwen3-4B-Instruct-2507 Модель, на которой проводилась проверка гипотезы. Эффект не удалось воспроизвести, что указывает на зависимость от масштаба модели.

Почему это важно?

Если интроспекция и другие наблюдаемые при стиринге поведения являются артефактами методологии, то многие текущие заявления о «внутреннем мире» LLM могут быть преувеличены. Это требует пересмотра стандартов валидации в области интерпретируемости нейросетей (XAI) и осторожности при объявлении моделей «самоосознающими».

Источник: LessWrong ↗