Суть открытия: от теории к практике
Долгое время существование суперпозиции (superposition) в больших языковых моделях (LLM) оставалось теоретической конструкцией. Идея гласит, что нейросети представляют больше концепций, чем имеют размерностей в своих слоях, «упаковывая» их в одно пространство. Однако прямых доказательств того, что модели вычисляют в этом режиме, не было. Новая работа исследователей Francisco Ferreira da Silva и StefanHex предоставляет первое эмпирическое подтверждение этого явления через обнаружение механизма Feature-Specific Error Correction (FSEC) — коррекции ошибок, специфичной для признаков.
Согласно теории Хэнни и соавторов (2024), вычисление в суперпозиции неизбежно порождает интерференцию: активация одного признака создает шум для других. Чтобы сохранить полезный сигнал, сеть должна подавлять этот шум, но делать это избирательно — быть менее чувствительной к возмущениям в «не-признаковых» направлениях и более чувствительной к изменениям в самих признаках. Именно эту асимметрию чувствительности и удалось зафиксировать авторам.
Методология: тест на «плоскостях активации»
Исследователи использовали метод activation plateaus (плоскостей активации). Они вносили небольшие возмущения в остаточный поток (residual stream) ранних слоев моделей и измеряли отклик downstream. Ключевой метрикой стал параметр p в норме l_p:
- p = 2: Квадратичная форма, где нет привилегированных направлений (случайные/PCA векторы).
- p > 2 (вплоть до бесконечности): Чистые направления привилегированы над их смесью. Это и есть предсказание FSEC.
Если модель использует суперпозицию, она должна реагировать сильнее на чистый вектор признака, чем на его линейную комбинацию с другим признаком. Авторы протестировали это на трех типах направлений: контрастных (contrastive), латентах разреженных автоэнкодеров (SAE) и направлениях MELBO.
Результаты:一致性 across 6 семейств моделей
Эксперимент проводился на шести различных архитектурах LLM. Результаты единообразно показали значение p > 2 для кандидатов в признаки, что подтверждает гипотезу FSEC. Для сравнения, случайные векторы и PCA-компоненты давали p ≈ 2.
| Тип направления | Значение p | Интерпретация |
|---|---|---|
| Контрастные признаки (языки, пол, тональность) | p > 2 | Подтверждение FSEC: чистые признаки привилегированы |
| Латенты SAE (Sparse Autoencoders) | p > 2 (меньшее значение) | SAE успешно извлекают направления, с которыми работает FSEC |
| Направления MELBO | p > 2 (меньшее значение) | Методы поиска признаков также попадают в «чувствительные» зоны |
| PCA / Случайные векторы | p ≈ 2 | Нет привилегии направлений, стандартная евклидова геометрия |
Эффект воспроизвелся на моделях: Gemma-2-9B, Qwen3-1.7B, Llama-3.1-8B, Mistral-7B-v0.3, Aya-Expanse-8B и Yi-1.5-9B. Дополнительно эффект был подтвержден на синтетической модели с известными «истинными» признаками, где параметр p корректно снижался к 2 при повороте векторов away от истинных признаков.
Почему это важно для индустрии
1. Обоснование интерпретируемости. Успех SAE и MELBO в извлечении интерпретируемых направлений теперь имеет под собой физическое обоснование: эти методы находят не просто статистические корреляции, а реальные «оси» вычислений, защищенные механизмом коррекции ошибок.
2. Новый подход к поиску признаков. Изначально авторы предполагали использовать максимизацию p как unsupervised objective для поиска новых признаков. Однако ранние результаты показали, что высокий p является необходимым, но не достаточным условием: можно найти направления с высоким p, которые не ведут себя как функциональные признаки. Это задает вектор для дальнейших исследований в области интерпретируемости.
3. Закрытый вопрос о суперпозиции. Хотя доказать суперпозицию напрямую невозможно без знания «истинных» признаков, обнаружение FSEC служит сильным косвенным доказательством. Если бы модели не вычисляли в суперпозиции, им не требовался бы такой специфический механизм подавления интерференции.
Код для воспроизведения экспериментов доступен на GitHub: github.com/FranciscoHS/fsec-paper.
Источник: LessWrong ↗
