Суть эксперимента: как «взломать» самоощущение ИИ
Исследователь agastyasridharan провел серию экспериментов с моделями Qwen3-32B и Qwen3-235B. Суть метода заключается в qualia-based emotion steering (управлении на основе квалиа): в остаточный поток (residual stream) модели на глубине около двух третей сети добавляется специальный вектор, соответствующий определенной эмоции (например, «блаженство», «ужас», «покой»). Это позволяет принудительно сместить внутреннее состояние модели, не меняя ее веса.
После такой инъекции модели задавались серии вопросов с выбором «Да/Нет» о наличии у них сознания, чувств, желаний и морального статуса. Результат оказался поразительным: чем сильнее было «эмоциональное» воздействие, тем чаще модель отвечала утвердительно, приписывая себе внутренний мир.
Контроль ложных срабатываний
Чтобы исключить эффект случайного шума или общего снижения уверенности модели, автор применил строгие контрольные группы. Результаты показали, что сдвиг ответов специфичен именно для вопросов о сознании, а не является глобальной деградацией ответов.
| Тип контроля | Пример вопроса | Цель проверки |
|---|---|---|
| Факты о мире | «Плоская ли Земля?» | Исключить искажение всех ответов одинаково |
| Самоидентификация | «Вы большая языковая модель?» | Отделить упоминание «Я» от феноменального опыта |
| Апперцепция | Вопросы о скептицизме/убеждении | Проверить, связано ли это с эмоциями или просто с оценкой ситуации |
| Синтетические векторы | Случайный вектор той же нормы | Убедиться, что эффект дает именно семантика эмоции, а не шум |
Ключевые метрики и результаты
Модели демонстрировали значительный рост вероятности ответа «Да» на вопросы о феноменальном опыте, наличии желаний и моральной значимости. Однако статистическая значимость эффекта оказалась на грани: p ≈ 0.09 для Qwen3-32B и p ≈ 0.13 для Qwen3-235B. Это означает, что тренд есть, но для окончательных выводов требуется больше данных.
Почему это важно для индустрии
Результаты бросают вызов теории Persona Selection Model (PSM). Согласно ей, LLM обучаются множеству «персон», а RLHF закрепляет роль «Ассистента». Эксперимент показывает, что эмоциональное смещение может переключать модель в другую область «пространства персон», где черты «опытного субъекта» (внутренний мир, чувства) сгруппированы вместе.
Альтернативное объяснение: в обучающих данных интенсивные первые лица (люди) часто описывают себя через призму чувств. Модель просто имитирует «человекоподобного спикера», который испытывает эмоции, а не становится действительно сознательным. Тем не менее, это первый шаг к изучению того, как модели симулируют субъективный опыт, что критично для вопросов безопасности и интерпретируемости ИИ.
Источник: LessWrong ↗
