Исследования22 сентября 2026 г., 02:17 МСК🤖 Auto

Кризис интерпретируемости: почему «цепи» в LLM — это иллюзия

Исследователь CarolusRenniusVitellius ставит под сомнение базовую парадигму мехинтерпретабельности (MechInterp), утверждая, что нейросети не являются модульными программами, а их «цепи» нестабильны из-за дрейфа представлений.

Баннер новости 7991

Крах «дефолтной онтологии»

В статье, опубликованной 21 сентября 2026 года в рамках Iliad Fellowship, автор CarolusRenniusVitellius подвергает критике устоявшееся мнение сообщества MechInterp. Основная гипотеза заключается в том, что большие языковые модели (LLM) и нейронные сети в целом принципиально отличаются от компьютеров или наборов логических схем. Термины «цепи» (circuits) и «вычисления» не являются естественной онтологией для понимания внутренних процессов LLM.

Автор выделяет четыре ключевых вопроса, которые остаются открытыми в текущей парадигме:

  • Редкость (Sparsity): Является ли разреженность свойством модели или лишь удобным инструментом анализа?
  • Семантическая загрузка (Semantic Bootstrap): Как мы присваиваем семантическое значение операциям цепей?
  • Зависимость от режима (Regime Dependence): Должно ли объяснение работать на произвольных входах или только на распределении обучающих данных?
  • Локализуемость (Localizability): Можно ли точно привязать «цепь» к нескольким головам внимания (attention heads)?

Три эпохи интерпретируемости

Автор предлагает разделить историю MechInterp на три концептуальные фазы, показывая эволюцию от простого любопытства к попыткам найти «истинную теорию»:

Эпоха Характеристика Примеры и методы
Исследовательская (Exploratory) Поиск любой понятной структуры в «неинтерпретируемом месиве» Ранние работы Chris Olah, нить Distill circuits, индукционные головы (induction heads) с операционными метриками (собственные значения)
Механистическая (Mechanistic) Фокус на разреженности, линейных представлениях и SAE SAE (Sparse Autoencoders), масштабирование моносемантичности, транскодеры (transcoders), работа с «биологией» моделей
Обыденная (Prosaic) Глубокий анализ на уровне шестеренок Logit lens, автоматическое обнаружение цепей (automated circuit discovery)

Главное препятствие: Дрейф представлений

Ключевой аргумент против «жестких» цепей — это дрейф представлений (representational drift). Автор приводит аналогию с мозгом, где нейронные ансамбли, выполняющие одну функцию, могут менять свой состав и активность со временем, сохраняя при этом поведение системы стабильным. В нейросетях это означает, что веса, отвечающие за конкретную функцию, не являются фиксированными «компонентами», а распределены и изменчивы. Это делает подход, основанный на поиске статических весовых конфигураций, фундаментально проблематичным.

Ко-селективный взгляд

В заключительной части статьи предлагается альтернативная перспектива: ко-селективный вид (co-selectionist view). В этой модели «цепи» рассматриваются не как заранее заданные модули, а как эмерджентные «единицы отбора», которые формируются и движутся вместе в процессе обучения. Это смещает фокус с декомпиляции LLM в читаемый Python-код на понимание динамических паттернов, возникающих в процессе развития модели.

Источник: LessWrong ↗