Исследования30 июня 2026 г., 16:18 МСК🤖 Auto

Иллюзия эмпатии: как LLM учатся понимать чужие мысли

Исследование arXiv показывает, что способность LLM к «ментализации» (пониманию чужих убеждений) — хрупкий навык, возникающий на поздних стадиях обучения и легко разрушаемый синтаксическими ловушками.

Баннер новости 2574

Суть исследования: от фактов к убеждениям

Команда исследователей (Pamela D. Rivière, Cameron Jones, Sean Trott) проанализировала развитие моделей Olmo2 и Pythia через призму детской психологии. Они отслеживали, как именно нейросети переходят от простого запоминания фактов к пониманию того, что знает или думает другой персонаж. Ключевой метрикой стала задача ложного убеждения (False Belief Task, FBT) — классический тест на Theory of Mind.

Три этапа развития модели

Авторы выявили четкую траекторию появления способностей, которая не совпадает с линейным ростом параметров:

  • Ситуационное моделирование (Situation Modeling): Способность точно описывать физические свойства сцены появляется первой. Точность здесь высокая и стабильная.
  • Ментализация (Mentalizing): Понимание того, что персонаж ошибается в своих знаниях, emerges (возникает) относительно поздно, только при достаточном объеме данных (training volume) и размере модели.
  • Фрагментарность: Даже крупные модели (например, Olmo2 13b) демонстрируют «когнитивный диссонанс», путаясь в логике, когда нужно учесть знания антагониста.

Эксперимент с глаголами: ловушка синтаксиса

Самое важное открытие — хрупкость результатов. Исследователи обнаружили, что использование нефактивных глаголов (non-factive verbs), таких как «думает» (thinks), искусственно завышает показатели эмпатии. Модель начинает приписывать персонажам ложные убеждения даже в ситуациях, где персонаж обладает истинным знанием (True Belief condition). Это указывает на то, что LLM часто реагируют на лингвистические паттерны, а не на глубокое логическое моделирование.

Результаты тестирования Olmo2 13b

Метрика / Условие Результат / Наблюдение Значение
Точность ситуационного моделирования Высокая, стабильная База для понимания текста
FBT (False Belief, Implicit) Лучшее улучшение после SFT/DPO Пост-обучение критически важно
Влияние глагола «думает» Ложные срабатывания в True Belief Синтаксис важнее логики
Знания Антагониста Модель путается в состояниях Нарушение когерентности

Почему это важно

Результаты ставят под сомнение валидность текущих бенчмарков, которые хвалят LLM за «понимание контекста». Если модель легко обманывается глаголами вроде «считает», её способность к сложному рассуждению остается поверхностной. Исследование предлагает использовать developmental stress-testing (стресс-тестирование на этапе развития) для выявления таких уязвимостей до внедрения моделей в критические задачи.

Источник: arXiv cs.CL ↗