Исследования5 сентября 2026 г., 06:18 МСК🤖 Auto

LLM-мозг: Выравнивание не объясняет механизм работы

Новая работа Эллиота Мерфи ставит под сомнение главную идею нейронауки: совпадение представлений LLM и мозга не доказывает, что они решают задачи одинаково.

Баннер новости 6831

Кризис интерпретации в LLM-brain alignment

В центре научного спора — статья Настасе и соавторов (2026), утверждающая, что большие языковые модели (LLM) могут служить «полностью механистической моделью» языка, так как оба системы опираются на распределенные, контекстно-зависимые представления. Однако Эллиот Мерфи в своей работе (arXiv:2609.03160, сентябрь 2026) указывает на фундаментальную логическую ошибку: выравнивание представлений (representational alignment) не тождественно выравниванию механизмов.

Проблема недоопределенности

Мерфи выделяет три типа недоопределенности (underdetermination), которые делают невозможным вывод о том, что LLM «думают» как мозг:

  • Логическая: Совпадение входных и выходных данных (или векторных представлений) не доказывает идентичность внутренней архитектуры.
  • Причинная: Модель может захватывать признаки, коррелирующие с нейронной активностью, без использования тех же алгоритмов.
  • Вычислительная: Разные вычислительные пути могут приводить к одинаковым функциональным результатам.

Сравнение подходов

Ключевое различие между позицией сторонников и критикой выглядит следующим образом:

Критерий Позиция Настасе et al. (2026) Позиция Эллиота Мерфи (2026)
Цель LLM Полностью механистическая модель языка Инструмент для ограничения гипотез, но не их доказательства
Связь с мозгом Общие вычислительные принципы Совпадение представлений ≠ общий алгоритм
Статус модели Имитация биологического мозга Эмпирическая корреляция без каузальной связи

Почему это важно?

Исследователи часто используют метрики сходства (например, RSA — Representational Similarity Analysis) для утверждения, что LLM «понимают» язык так же, как люди. Мерфи предупреждает: это опасная иллюзия. Если мы примем LLM за механистическую модель мозга, мы рискуем строить теории о когнитивных процессах на основе артефактов архитектуры нейросетей, а не биологии. Выравнивание данных — это лишь первый шаг, а не финальное объяснение того, как работает разум.

Источник: arXiv cs.CL ↗