Проблема суперпозиции и ограничения прошлых исследований
Современные AI-модели достигают выдающихся результатов благодаря способности к сжатию данных. Однако архитектурные ограничения (например, размерность скрытого слоя 768 в GPT-2 при словаре в 50 257 токенов) вынуждают модели использовать суперпозицию — хранение большего числа признаков, чем доступно измерений. Это приводит к появлению полисемантичных нейронов, что затрудняет интерпретируемость.
Ранее исследователи (Elhage et al., 2022) на двухслойных ReLU-сетях с связанными весами пришли к выводу, что оптимальной геометрией для хранения независимых признаков являются равномерные многогранники (симметричные решения). Однако новое исследование Bartosza Репковского и коллег ставит этот вывод под сомнение, доказывая, что симметрия — это артефакт слишком простых архитектур.
Новый подход: линейный энкодер и глубокий декодер
Авторы изучали задачу реконструкции входных данных в модели, состоящей из линейного энкодера (сужающего пространство до 2D) и стека многослойных перцептронов (MLP) с билинейной активацией, выступающих в роли декодера. В экспериментах использовались 4 независимых признака с низкой вероятностью активации ($p=0.05$).
Ключевое отличие от предыдущих работ: использование более выразительных глубоких моделей позволяет найти решения с меньшей ошибкой реконструкции (MSE), чем симметричные конфигурации.
Сравнение стратегий кодирования
Исследование сравнивает классический симметричный подход с найденным асимметричным решением. Ниже приведена сравнительная таблица характеристик:
| Характеристика | Симметричное решение (классическое) | Асимметричное решение (новое) |
|---|---|---|
| Геометрия | Равномерные многогранники (антиподальные пары на ортогональных осях) | Несимметричные конфигурации |
| Архитектура декодера | Двухслойная ReLU-сеть со связанными весами | Стек MLP с билинейной активацией |
| Качество реконструкции (MSE) | Выше (субоптимально) | Ниже (ближе к теоретическому минимуму) |
| Обоснование | Артефакт ограниченной выразительности модели | Достигается за счет глубины и выразительности |
Теоретический базис и значимость
Авторы вывели два теоретических бенчмарка декодера: аналитическое решение (при известном распределении данных) и аппроксимацию на основе выборок. Сравнение реальных моделей с этими бенчмарками показало, что только sufficiently powerful (достаточно мощные) модели способны отойти от симметрии.
Результаты важны для понимания вычислений в LLM, так как трансформеры также используют линейный энкодер на первом этапе. Понимание того, как глубокие сети обходят ограничения суперпозиции через асимметрию, открывает путь к созданию более интерпретируемых и эффективных архитектур.
Источник: LessWrong ↗
