Проблема старых моделей
Ранее существовавшая «игрушечная модель» сжатых вычислений (Braun et al., 2025) состояла из одного скрытого слоя с 50 нейронами ReLU, который должен был обрабатывать 100 разреженных входных признаков. Ожидалось, что сеть реализует Computation in Superposition (CiS) — способность выполнять больше нелинейных операций, чем количество нейронов. Однако анализ Bhagat et al. (2025) показал, что сеть не вычисляла в суперпозиции: её преимущество над базовыми моделями давала остаточная связь (residual connection), а не совместное использование нейронов.
Ключевое изменение: L⁴ Loss
Авторы (Francisco Ferreira da Silva, StefanHex) устранили остаточную связь и изменили функцию потерь с MSE (L²) на L⁴. Интуиция проста: L⁴-потеря сильнее штрафует за крупные ошибки (outliers). Это заставляет сеть искать решение, где все признаки обрабатываются равномерно, а не игнорировать половину из них, как это делала модель с MSE.
Результаты обратного инжиниринга
Обученная сеть действительно реализует CiS. Архитектура решения оказалась простой и интерпретируемой:
- Кодирование: Каждый из 100 признаков кодируется разреженным бинарным кодом, использующим 5–7 нейронов.
- Декодирование: Выходной слой близок к псевдообратной матрице энкодера. Признак считывается по тем же нейронам, что и кодировался.
- Параметризация: Поведение сети полностью описывается всего тремя скалярами на признак: значение «on-code», значение «off-code» и масштаб декодера.
Сравнение подходов
| Характеристика | Модель Braun et al. (2025) | Новая модель (L⁴ Loss) |
|---|---|---|
| Функция потерь | MSE (L²) | L⁴ |
| Остаточная связь | Есть | Нет |
| Реализация CiS | Нет (эффект от residual) | Да (истинная суперпозиция) |
| Механизм | Смешивание через residual | Разреженные бинарные коды (5-7 нейронов) |
| Интерпретируемость | Сложная, артефактная | Высокая (3 скаляра на признак) |
Значимость для интрпретируемости
Это одна из первых моделей, где CiS возникает естественным путем в процессе обучения, а не задается вручную. Наличие известного ground-truth механизма (бинарные коды) позволяет теперь корректно тестировать методы декомпозиции параметров, такие как APD и SPD, которые ранее не могли быть валидированы на этой задаче. Эксперименты с вручную заданными бинарными кодами показали, что они достигают той же точности, что и обученная сеть, подтверждая гипотезу о природе найденного решения.
Источник: LessWrong ↗
