Проблема локального обучения в глубоких сетях
Стандартный алгоритм обратного распространения ошибки (Backpropagation, BP) требует глобальной синхронизации: прямой проход, затем обратный, затем обновление весов. Мозг человека не использует такой механизм, что стимулирует поиск локальных альтернатив, таких как предиктивное кодирование (Predictive Coding, PC). Однако классическое PC страдает от «затухания сигнала»: в глубоких и узких сетях обучающий сигнал не доходит до входных слоев, что резко снижает точность модели.
Решение: PC-ALM и механизм PI-контроллера
Команда Sakana AI предлагает Augmented Lagrangian Predictive Coding (PC-ALM). Метод сохраняет локальность обновлений, но добавляет к каждому слою множитель Лагранжа. Это позволяет сети накапливать ошибку предсказания (интегральная составляющая) и реагировать на текущее отклонение (пропорциональная составляющая), работая как PI-контроллер для каждого слоя. В линейных сетях доказано, что эти множители сходятся к точным градиентам обратного распространения.
Результаты бенчмарков
Исследователи протестировали метод на Fashion-MNIST и MNIST, варьируя ширину и глубину сетей. PC-ALM демонстрирует стабильность там, где классическое PC проваливается. Ниже приведены ключевые метрики для референсной ячейки (ширина 32, глубина 32, ReLU, Fashion-MNIST):
| Метод | Точность (Test Accuracy) | Косинусное сходство градиентов с BP |
|---|---|---|
| Backpropagation (BP) | 78.66% | 1.000 (база) |
| PC-ALM (предложенный метод) | 77.75% | 0.909 |
| Классическое PC | 68.13% | 0.604 |
Главное достижение: метод успешно обучил резидюальные MLP с 1000 слоями на датасете MNIST. Потеря в точности по сравнению с BP составила всего около 2 процентных пункта, что делает PC-ALM первым практическим шагом к обучению сверхглубоких сетей без глобальной синхронизации.
Доступность и внедрение
Код реализован на JAX и лицензирован под MIT. Он воспроизводим на CPU и охватывает сетки параметров от 8 до 128 слоев. Важно отметить, что PC-ALM — это метод обучения, а не новая архитектура модели. Пока что он протестирован на небольших изображениях (MNIST, Fashion-MNIST, CIFAR-10, Tiny ImageNet), но открывает путь к более энергоэффективным и биологически правдоподобным вычислительным системам.
Источник: MarkTechPost ↗
