Суть исследования: от фактов к убеждениям
Команда исследователей (Pamela D. Rivière, Cameron Jones, Sean Trott) проанализировала развитие моделей Olmo2 и Pythia через призму детской психологии. Они отслеживали, как именно нейросети переходят от простого запоминания фактов к пониманию того, что знает или думает другой персонаж. Ключевой метрикой стала задача ложного убеждения (False Belief Task, FBT) — классический тест на Theory of Mind.
Три этапа развития модели
Авторы выявили четкую траекторию появления способностей, которая не совпадает с линейным ростом параметров:
- Ситуационное моделирование (Situation Modeling): Способность точно описывать физические свойства сцены появляется первой. Точность здесь высокая и стабильная.
- Ментализация (Mentalizing): Понимание того, что персонаж ошибается в своих знаниях, emerges (возникает) относительно поздно, только при достаточном объеме данных (training volume) и размере модели.
- Фрагментарность: Даже крупные модели (например, Olmo2 13b) демонстрируют «когнитивный диссонанс», путаясь в логике, когда нужно учесть знания антагониста.
Эксперимент с глаголами: ловушка синтаксиса
Самое важное открытие — хрупкость результатов. Исследователи обнаружили, что использование нефактивных глаголов (non-factive verbs), таких как «думает» (thinks), искусственно завышает показатели эмпатии. Модель начинает приписывать персонажам ложные убеждения даже в ситуациях, где персонаж обладает истинным знанием (True Belief condition). Это указывает на то, что LLM часто реагируют на лингвистические паттерны, а не на глубокое логическое моделирование.
Результаты тестирования Olmo2 13b
| Метрика / Условие | Результат / Наблюдение | Значение |
|---|---|---|
| Точность ситуационного моделирования | Высокая, стабильная | База для понимания текста |
| FBT (False Belief, Implicit) | Лучшее улучшение после SFT/DPO | Пост-обучение критически важно |
| Влияние глагола «думает» | Ложные срабатывания в True Belief | Синтаксис важнее логики |
| Знания Антагониста | Модель путается в состояниях | Нарушение когерентности |
Почему это важно
Результаты ставят под сомнение валидность текущих бенчмарков, которые хвалят LLM за «понимание контекста». Если модель легко обманывается глаголами вроде «считает», её способность к сложному рассуждению остается поверхностной. Исследование предлагает использовать developmental stress-testing (стресс-тестирование на этапе развития) для выявления таких уязвимостей до внедрения моделей в критические задачи.
Источник: arXiv cs.CL ↗
