Исследования18 июля 2026 г., 10:16 МСК🤖 Auto

Sakana AI: Обучение без обратного распространения ошибки (96.7% MNIST)

Исследователи Sakana AI представили метод Error Diffusion, позволяющий обучать нейросети, подчиняющиеся принципу Дейла, без использования обратного распространения ошибки (backpropagation).

Баннер новости 3875

Проблема транспорта весов и принцип Дейла

Стандартное обучение глубоких нейронных сетей опирается на обратное распространение ошибки (backpropagation), которое требует точных транспонированных матриц весов для обратного прохода. Этот механизм считается биологически нереалистичным из-за «проблемы транспорта весов» (weight transport problem). Команда Sakana AI в работе Diffusing Blame предлагает альтернативу: обучение сетей, соблюдающих принцип Дейла (Dale’s principle), где синапсы могут быть только возбуждающими или только тормозными, без транспонирования весов.

Архитектура Dual-Stream и Error Diffusion

Для реализации этого подхода исследователи разделили каждый слой на два потока: возбуждающий ($p$) и тормозной ($n$). Все обучаемые матрицы весов остаются неотрицательными, а ингибирующие связи задаются структурно. Ключевым нововведением стало modulo error routing — маршрутизация ошибки через операцию модуля ($r(i) = i \mod C$), что позволяет применять локальное правило обучения Error Diffusion (ED) к многоклассовой классификации и сверточным сетям.

Результаты на бенчмарках

Внедрение трех инноваций (ширина сигмоиды, центрирование ошибки по классам, асимметричная инициализация) позволило достичь значимых результатов. Метод ED стал первым, успешно обучившим сверточную сеть без backpropagation. Ниже приведено сравнение точности:

d>Seed ED
Метод MNIST CIFAR-10 Dale-compliant Примечания
Proposed ED 96.7% 61.7% Да Все веса неотрицательны; первое ED на CNN
50.4% 11.6% Да Без инноваций; α = 1.0
DFA 97.6% 69.1% Нет Случайная обратная связь; ~2.84M отрицательных весов

Применение в обучении с подкреплением (RL)

Метод ED-PPO был протестирован в задачах локомоции (Brax) и навигации (Craftax). На среде HalfCheetah ED-PPO превзошел BP-PPO (5494 против 3520; p < 0.001), а на Craftax показал лучшие результаты, чем DFA-PPO. Это указывает на то, что случайная обратная связь, достаточная для классификации, может быть недостаточной для сложных RL-задач.

Практическая значимость

Метод открывает путь для эффективного обучения на нейроморфном и фотонном оборудовании, где физически невозможно реализовать отрицательные веса. Кроме того, метод обеспечивает неявную разреженность: 37.3% весов обнуляются, а до 68.8% ингибирующих связей в полносвязных слоях отбрасываются, что потенциально позволяет сжимать модели «бесплатно».

Источник: MarkTechPost ↗