Исследования15 июля 2026 г., 01:17 МСК🤖 Auto

Доказательство «суперпозиции»: как LLM исправляют ошибки в скрытых признаках

Исследователи впервые эмпирически подтвердили гипотезу о том, что нейросети вычисляют в суперпозиции, используя механизм коррекции ошибок, специфичный для каждого признака (FSEC).

Баннер новости 3578

Суть открытия: от теории к практике

Долгое время существование суперпозиции (superposition) в больших языковых моделях (LLM) оставалось теоретической конструкцией. Идея гласит, что нейросети представляют больше концепций, чем имеют размерностей в своих слоях, «упаковывая» их в одно пространство. Однако прямых доказательств того, что модели вычисляют в этом режиме, не было. Новая работа исследователей Francisco Ferreira da Silva и StefanHex предоставляет первое эмпирическое подтверждение этого явления через обнаружение механизма Feature-Specific Error Correction (FSEC) — коррекции ошибок, специфичной для признаков.

Согласно теории Хэнни и соавторов (2024), вычисление в суперпозиции неизбежно порождает интерференцию: активация одного признака создает шум для других. Чтобы сохранить полезный сигнал, сеть должна подавлять этот шум, но делать это избирательно — быть менее чувствительной к возмущениям в «не-признаковых» направлениях и более чувствительной к изменениям в самих признаках. Именно эту асимметрию чувствительности и удалось зафиксировать авторам.

Методология: тест на «плоскостях активации»

Исследователи использовали метод activation plateaus (плоскостей активации). Они вносили небольшие возмущения в остаточный поток (residual stream) ранних слоев моделей и измеряли отклик downstream. Ключевой метрикой стал параметр p в норме l_p:

  • p = 2: Квадратичная форма, где нет привилегированных направлений (случайные/PCA векторы).
  • p > 2 (вплоть до бесконечности): Чистые направления привилегированы над их смесью. Это и есть предсказание FSEC.

Если модель использует суперпозицию, она должна реагировать сильнее на чистый вектор признака, чем на его линейную комбинацию с другим признаком. Авторы протестировали это на трех типах направлений: контрастных (contrastive), латентах разреженных автоэнкодеров (SAE) и направлениях MELBO.

Результаты:一致性 across 6 семейств моделей

Эксперимент проводился на шести различных архитектурах LLM. Результаты единообразно показали значение p > 2 для кандидатов в признаки, что подтверждает гипотезу FSEC. Для сравнения, случайные векторы и PCA-компоненты давали p ≈ 2.

Тип направления Значение p Интерпретация
Контрастные признаки (языки, пол, тональность) p > 2 Подтверждение FSEC: чистые признаки привилегированы
Латенты SAE (Sparse Autoencoders) p > 2 (меньшее значение) SAE успешно извлекают направления, с которыми работает FSEC
Направления MELBO p > 2 (меньшее значение) Методы поиска признаков также попадают в «чувствительные» зоны
PCA / Случайные векторы p ≈ 2 Нет привилегии направлений, стандартная евклидова геометрия

Эффект воспроизвелся на моделях: Gemma-2-9B, Qwen3-1.7B, Llama-3.1-8B, Mistral-7B-v0.3, Aya-Expanse-8B и Yi-1.5-9B. Дополнительно эффект был подтвержден на синтетической модели с известными «истинными» признаками, где параметр p корректно снижался к 2 при повороте векторов away от истинных признаков.

Почему это важно для индустрии

1. Обоснование интерпретируемости. Успех SAE и MELBO в извлечении интерпретируемых направлений теперь имеет под собой физическое обоснование: эти методы находят не просто статистические корреляции, а реальные «оси» вычислений, защищенные механизмом коррекции ошибок.

2. Новый подход к поиску признаков. Изначально авторы предполагали использовать максимизацию p как unsupervised objective для поиска новых признаков. Однако ранние результаты показали, что высокий p является необходимым, но не достаточным условием: можно найти направления с высоким p, которые не ведут себя как функциональные признаки. Это задает вектор для дальнейших исследований в области интерпретируемости.

3. Закрытый вопрос о суперпозиции. Хотя доказать суперпозицию напрямую невозможно без знания «истинных» признаков, обнаружение FSEC служит сильным косвенным доказательством. Если бы модели не вычисляли в суперпозиции, им не требовался бы такой специфический механизм подавления интерференции.

Код для воспроизведения экспериментов доступен на GitHub: github.com/FranciscoHS/fsec-paper.

Источник: LessWrong ↗