Кризис интерпретации в LLM-brain alignment
В центре научного спора — статья Настасе и соавторов (2026), утверждающая, что большие языковые модели (LLM) могут служить «полностью механистической моделью» языка, так как оба системы опираются на распределенные, контекстно-зависимые представления. Однако Эллиот Мерфи в своей работе (arXiv:2609.03160, сентябрь 2026) указывает на фундаментальную логическую ошибку: выравнивание представлений (representational alignment) не тождественно выравниванию механизмов.
Проблема недоопределенности
Мерфи выделяет три типа недоопределенности (underdetermination), которые делают невозможным вывод о том, что LLM «думают» как мозг:
- Логическая: Совпадение входных и выходных данных (или векторных представлений) не доказывает идентичность внутренней архитектуры.
- Причинная: Модель может захватывать признаки, коррелирующие с нейронной активностью, без использования тех же алгоритмов.
- Вычислительная: Разные вычислительные пути могут приводить к одинаковым функциональным результатам.
Сравнение подходов
Ключевое различие между позицией сторонников и критикой выглядит следующим образом:
| Критерий | Позиция Настасе et al. (2026) | Позиция Эллиота Мерфи (2026) |
|---|---|---|
| Цель LLM | Полностью механистическая модель языка | Инструмент для ограничения гипотез, но не их доказательства |
| Связь с мозгом | Общие вычислительные принципы | Совпадение представлений ≠ общий алгоритм |
| Статус модели | Имитация биологического мозга | Эмпирическая корреляция без каузальной связи |
Почему это важно?
Исследователи часто используют метрики сходства (например, RSA — Representational Similarity Analysis) для утверждения, что LLM «понимают» язык так же, как люди. Мерфи предупреждает: это опасная иллюзия. Если мы примем LLM за механистическую модель мозга, мы рискуем строить теории о когнитивных процессах на основе артефактов архитектуры нейросетей, а не биологии. Выравнивание данных — это лишь первый шаг, а не финальное объяснение того, как работает разум.
Источник: arXiv cs.CL ↗
