Суть проблемы: MSE не создает суперпозицию
Исследователи Philh и Linda Linsefors провели анализ, доказывающий, что использование Mean Squared Error (MSE) для обучения нейросетей не создает условий для суперпозиции — явления, когда модель хранит больше признаков (features), чем у нее есть нейронов в скрытом слое. Вместо компактного кодирования в суперпозиции, сеть при MSE-потере склонна к «размазыванию» признаков или их игнорированию, если есть другие факторы, толкающие к не-суперпозиционному решению.
Это критично для исследователей интерпретируемости (AI Alignment), так как многие «игрушечные модели» (toy models) для изучения механизмов внимания и суперпозиции ошибочно используют MSE, получая артефакты вместо реального поведения.
Экспериментальная проверка
Авторы обучали линейные автоэнкодеры с разными архитектурами, пытаясь сжать T признаков в D нейронов (T > D). Тестировались четыре функции потерь. Результаты визуализации эмбеддингов показали, что только MSE дает непредсказуемые, часто «схлопнутые» векторы, в то время как другие функции стабильно формируют углы между векторами, характерные для суперпозиции.
| Функция потерь | Результат для суперпозиции | Математическая природа |
|---|---|---|
| MSE (L2) | Не работает. Векторы часто накладываются друг на друга. Нет стимула для ортогонализации. | Квадрат L2-нормы. Минимизирует ошибку, но не штрафует за «близость» векторов признаков. |
| BCE (Binary Cross-Entropy) | Работает. Формирует четкие, разделенные векторы. | Работает с вероятностями активации, создавая нелинейные барьеры. |
| L4 (Mean of 4th power) | Работает. Стабильная суперпозиция. | Более сильная нелинейность, чем у L2, лучше разделяет активные признаки. |
| CE (Cross-Entropy) | Работает. Эффективное кодирование. | Стандарт для классификации, принуждает к «выбору» одного из состояний. |
Почему это важно для AI Research
Суперпозиция считается фундаментальным свойством больших языковых моделей (LLM), позволяющим им хранить миллионы концепций в ограниченном пространстве скрытых слоев. Если исследователи используют MSE в своих симуляциях, они могут получить ложноположительные или ложноотрицательные результаты о том, как работает интерпретируемость.
Авторы приводят математическое доказательство: при MSE-потере все возможные конфигурации эмбеддингов имеют одинаковую «стоимость» в пределе, поэтому оптимизатор не имеет градиентного сигнала, толкающего векторы признаков в разные стороны (ортогонализацию). Без этого сигнала суперпозиция не возникает спонтанно, если только она не задана случайной инициализацией.
Рекомендация
Для корректного моделирования суперпозиции в toy-моделях необходимо отказаться от MSE. Используйте L4 (среднее значение четвертой степени ошибки), BCE или Cross-Entropy. Эти функции создают необходимый ландшафт потерь, где минимизация ошибки требует эффективного разделения признаков в пространстве нейронов.
Источник: LessWrong ↗
