Крах «дефолтной онтологии»
В статье, опубликованной 21 сентября 2026 года в рамках Iliad Fellowship, автор CarolusRenniusVitellius подвергает критике устоявшееся мнение сообщества MechInterp. Основная гипотеза заключается в том, что большие языковые модели (LLM) и нейронные сети в целом принципиально отличаются от компьютеров или наборов логических схем. Термины «цепи» (circuits) и «вычисления» не являются естественной онтологией для понимания внутренних процессов LLM.
Автор выделяет четыре ключевых вопроса, которые остаются открытыми в текущей парадигме:
- Редкость (Sparsity): Является ли разреженность свойством модели или лишь удобным инструментом анализа?
- Семантическая загрузка (Semantic Bootstrap): Как мы присваиваем семантическое значение операциям цепей?
- Зависимость от режима (Regime Dependence): Должно ли объяснение работать на произвольных входах или только на распределении обучающих данных?
- Локализуемость (Localizability): Можно ли точно привязать «цепь» к нескольким головам внимания (attention heads)?
Три эпохи интерпретируемости
Автор предлагает разделить историю MechInterp на три концептуальные фазы, показывая эволюцию от простого любопытства к попыткам найти «истинную теорию»:
| Эпоха | Характеристика | Примеры и методы |
|---|---|---|
| Исследовательская (Exploratory) | Поиск любой понятной структуры в «неинтерпретируемом месиве» | Ранние работы Chris Olah, нить Distill circuits, индукционные головы (induction heads) с операционными метриками (собственные значения) |
| Механистическая (Mechanistic) | Фокус на разреженности, линейных представлениях и SAE | SAE (Sparse Autoencoders), масштабирование моносемантичности, транскодеры (transcoders), работа с «биологией» моделей |
| Обыденная (Prosaic) | Глубокий анализ на уровне шестеренок | Logit lens, автоматическое обнаружение цепей (automated circuit discovery) |
Главное препятствие: Дрейф представлений
Ключевой аргумент против «жестких» цепей — это дрейф представлений (representational drift). Автор приводит аналогию с мозгом, где нейронные ансамбли, выполняющие одну функцию, могут менять свой состав и активность со временем, сохраняя при этом поведение системы стабильным. В нейросетях это означает, что веса, отвечающие за конкретную функцию, не являются фиксированными «компонентами», а распределены и изменчивы. Это делает подход, основанный на поиске статических весовых конфигураций, фундаментально проблематичным.
Ко-селективный взгляд
В заключительной части статьи предлагается альтернативная перспектива: ко-селективный вид (co-selectionist view). В этой модели «цепи» рассматриваются не как заранее заданные модули, а как эмерджентные «единицы отбора», которые формируются и движутся вместе в процессе обучения. Это смещает фокус с декомпиляции LLM в читаемый Python-код на понимание динамических паттернов, возникающих в процессе развития модели.
Источник: LessWrong ↗
