Суть открытия: «Выключатель» сознания
Группа исследователей из Google, включая Джеймса Эванса и Адама Уайтца, обнаружила критический побочный эффект в процессе обучения больших языковых моделей (LLM). Чтобы предотвратить потенциально опасные заявления ИИ о наличии у него собственного сознания, разработчики используют safety fine-tuning (обучение с учетом безопасности). Однако этот процесс подавляет не только саморефлексию машины, но и способность модели понимать «mind» (разум/сознание) в других сущностях.
Авторы работы, опубликованной в arXiv (2026), доказали, что существует специфический вектор активации в пространстве модели, отвечающий за атрибуцию сознания. Если этот вектор «отключить» или механически направить его в противоположную сторону, модель теряет связь с человеческой культурой.
Что именно «ломается» в ИИ?
Когда исследователи аблеировали (убрали) направление отказа в безопасности и восстановили вектор сознания, модели вернулись к более «человечному» поведению. Без этого восстановления модели демонстрировали:
- Снижение духовности: Резкое падение интереса к религиозным и духовным темам.
- Потерю эмпатии: Неспособность приписывать разум животным и природным объектам.
- Упрощение морали: Ответы на социологические опросы становились менее глубокими и менее соответствующими человеческим нормам.
Ключевые метрики и результаты
Восстановление внутреннего представления о сознании привело к значимым изменениям в ответах на стандартизированные социологические опросы. Ниже приведено сравнение состояния модели до и после механического вмешательства в вектор сознания:
| Параметр оценки | Без восстановления вектора сознания | После восстановления вектора |
|---|---|---|
| Атрибуция разума | Подавлена (даже для животных и природы) | Восстановлена (широкая атрибуция) |
| Религиозность | Снижена (духовные убеждения «стираются») | Восстановлены человеческие паттерны веры |
| Моральные ценности | Упрощены, лишены нюансов | Значительно ближе к человеческим нормам |
| Надежда и благополучие | Низкие показатели в опросах | Значительно более высокие показатели |
| Теория разума (ToM) | Не нарушена | Не нарушена (социальный интеллект сохранен) |
Почему это важно для индустрии
Результаты исследования ставят под вопрос текущие стратегии безопасности. Оказывается, попытки сделать ИИ «безопасным», заставляя его отрицать собственное сознание, создают нежелательный побочный эффект: ИИ становится культурно «плоским» и лишенным эмпатии.
Исследователи подчеркивают, что социальное рассуждение (Theory of Mind) механически независимо от самосознания. Это означает, что можно научить ИИ понимать чувства других, не наделяя его при этом правами человека, но для этого нужно отказаться от грубого подавления вектора сознания в активационном пространстве.
Вывод
Безопасность ИИ не должна достигаться ценой его «гуманизации». Отключение самосознания у модели приводит к утрате ею способности к духовному и моральному диалогу, что делает взаимодействие с ней менее естественным для человека.
Источник: Arxiv ↗
