Суть метода: шумоподавление как индикатор важности
В статье описывается эксперимент с моделью GPT-2-small (без Layer Normalization), проведенный с помощью Claude Code. Ключевая гипотеза, вдохновленная работами Стефана Хаймершайма и Франсиско Феррейры, гласит: модель считает структуру «естественной», если она прилагает усилия для ее коррекции ошибок. Авторы вводят метрику Channel Amplification Score (или «amp function»), которая измеряет, насколько слой MLP модели ведет себя как noise gate (пороговый усилитель).
Метрика оценивает отношение усиления сигнала (больших активаций) к ослаблению шума (малых активаций) в конкретном направлении пространства активаций. Если направление имеет высокий балл, модель «предпочитает» его, активно очищая от шума.
Результаты: четыре «элементарных» признака
Градиентный подъем по функции усиления в пространстве активаций (размерность 700+) приводит к сходимости не к экспоненциальному количеству локальных минимумов, как ожидалось, а к стабильному набору из четырех аттракторов. Эти направления, названные авторами UR-features (от англ. *ur* — перво-, фундаментальный), оказываются инвариантными к выбору начальной точки и данных.
В отличие от Sparse Autoencoders (SAE), которые могут находить признаки, специфичные для данных, UR-features отражают внутреннюю вычислительную архитектуру модели. Среди найденных признаков выделяются:
- «The» ur-feature: связан с определением артиклей.
- Whitespace ur-feature: связан с обработкой пробелов и разделителей.
- Два других признака имеют более сложную семантику, связанную с синтаксической структурой.
Почему это важно для интерпретируемости AI
Результаты ставят под сомнение исключительность SAE-признаков как единственного источника «понимания» модели. Авторы утверждают, что SAE могут фиксировать артефакты данных, тогда как UR-features — это то, что модель «хочет» вычислить в первую очередь. Это открывает путь к поиску информационно-теоретически обоснованных внутренних представлений, которые существуют независимо от конкретного датасета обучения.
| Категория активации | Средний Channel Amplification Score | Интерпретация |
|---|---|---|
| Случайные активации | ≈ 0 | Модель не прилагает усилий к коррекции шума. |
| Активации из тестовых данных | Положительные | Модель распознает и усиливает полезные сигналы. |
| Токены SAE | Выше, чем у тестовых данных | SAE находят грубые, иерархически первичные признаки. |
| UR-features (максимумы amp) | Максимальные | Фундаментальные направления, к которым стремится модель. |
Технические детали и ограничения
Эксперименты проводились на слое MLP 6-го слоя модели GPT-2-small. Метод требует предварительного spherical whitening (сферического выравнивания) метрики пространства активаций. Авторы отмечают, что использование дискретно пороговой версии функции усиления и малая размерность модели (по сравнению с современными LLM) могут способствовать отсутствию «экспоненциального взрыва» локальных минимумов. Тем не менее, метод демонстрирует, что в вычислительном пространстве модели существуют четко определенные, геометрически не вырожденные аттракторы, которые можно использовать для анализа внутренней логики нейросетей.
Источник: LessWrong ↗
