Исследования15 июля 2026 г., 18:19 МСК🤖 Auto

L⁴-потеря заставляет нейросети вычислять в суперпозиции

Исследователи доказали: замена стандартной MSE на L⁴-потерю в компактных моделях заставляет нейросети использовать суперпозицию для вычислений, а не только для представлений.

Баннер новости 3641

Проблема старых моделей

Ранее существовавшая «игрушечная модель» сжатых вычислений (Braun et al., 2025) состояла из одного скрытого слоя с 50 нейронами ReLU, который должен был обрабатывать 100 разреженных входных признаков. Ожидалось, что сеть реализует Computation in Superposition (CiS) — способность выполнять больше нелинейных операций, чем количество нейронов. Однако анализ Bhagat et al. (2025) показал, что сеть не вычисляла в суперпозиции: её преимущество над базовыми моделями давала остаточная связь (residual connection), а не совместное использование нейронов.

Ключевое изменение: L⁴ Loss

Авторы (Francisco Ferreira da Silva, StefanHex) устранили остаточную связь и изменили функцию потерь с MSE (L²) на L⁴. Интуиция проста: L⁴-потеря сильнее штрафует за крупные ошибки (outliers). Это заставляет сеть искать решение, где все признаки обрабатываются равномерно, а не игнорировать половину из них, как это делала модель с MSE.

Результаты обратного инжиниринга

Обученная сеть действительно реализует CiS. Архитектура решения оказалась простой и интерпретируемой:

  • Кодирование: Каждый из 100 признаков кодируется разреженным бинарным кодом, использующим 5–7 нейронов.
  • Декодирование: Выходной слой близок к псевдообратной матрице энкодера. Признак считывается по тем же нейронам, что и кодировался.
  • Параметризация: Поведение сети полностью описывается всего тремя скалярами на признак: значение «on-code», значение «off-code» и масштаб декодера.

Сравнение подходов

Характеристика Модель Braun et al. (2025) Новая модель (L⁴ Loss)
Функция потерь MSE (L²) L⁴
Остаточная связь Есть Нет
Реализация CiS Нет (эффект от residual) Да (истинная суперпозиция)
Механизм Смешивание через residual Разреженные бинарные коды (5-7 нейронов)
Интерпретируемость Сложная, артефактная Высокая (3 скаляра на признак)

Значимость для интрпретируемости

Это одна из первых моделей, где CiS возникает естественным путем в процессе обучения, а не задается вручную. Наличие известного ground-truth механизма (бинарные коды) позволяет теперь корректно тестировать методы декомпозиции параметров, такие как APD и SPD, которые ранее не могли быть валидированы на этой задаче. Эксперименты с вручную заданными бинарными кодами показали, что они достигают той же точности, что и обученная сеть, подтверждая гипотезу о природе найденного решения.

Источник: LessWrong ↗