Обратное распространение ошибки (backpropagation) уже несколько десятилетий остается краеугольным камнем глубокого обучения. Однако этот алгоритм, на котором построена большая часть современных искусственных интеллектов, имеет фундаментальный недостаток с точки зрения нейробиологии. Механизм обратного прохода требует точных транспонированных матриц весов прямого прохода. Это порождает так называемую «проблему транспорта весов» (weight transport problem), которая, как считается, не может быть реализована в биологических нейронных сетях мозга. Именно эту проблему напрямую решает новая работа команды Sakana AI, представленная в статье «Diffusing Blame».
Исследователи разработали архитектуру, которая не только полностью избегает транспорта весов, но и строго подчиняется принципу Дейла (Dale’s principle). Этот биологический закон гласит, что нейрон может выделять только один тип нейромедиатора, то есть он либо возбуждает, либо тормозит другие нейроны, но не может делать и то, и другое одновременно. В контексте глубокого обучения это означает, что веса должны быть неотрицательными, а связи должны быть четко разделены на возбуждающие и тормозные. В этой статье мы подробно разберем, как работает метод Error Diffusion, почему он важен для создания биологически правдоподобных ИИ и какие практические преимущества он дает.
01Что такое Диффузия Ошибки (Error Diffusion)?
В основе нового подхода лежит локальное правило обучения, известное как Диффузия Ошибки (Error Diffusion, ED). Впервые предложенное Канеко в 2000 году, это правило кардинально отличается от градиентного спуска. В классическом backpropagation ошибка вычисляется на выходе сети и затем распространяется назад через все слои, требуя сложных вычислений производных и транспонирования матриц. В случае с ED обновление каждого веса зависит только от трех локальных сигналов:
- Активность пресинаптического нейрона (входного сигнала).
- Производной активации постсинаптического нейрона (выходного сигнала).
- Одного глобального знака ошибки (global error sign).
Ключевое преимущество такого подхода заключается в его локальности. Поскольку ED никогда не транспортирует транспонированные веса прямого прохода и не использует случайные матрицы обратной связи, оно естественным образом совместимо с принципом Дейла. Однако до недавнего времени этот метод демонстрировался лишь на задачах бинарной классификации или на простом наборе данных MNIST. Масштабирование ED на более сложные задачи и архитектуры оставалось открытой проблемой.
02Двухпоточная архитектура (Dual-Stream Architecture)
Чтобы удовлетворить строгим требованиям принципа Дейла и избежать отрицательных весов, команда Sakana AI предложила разделить каждый слой нейронной сети на два отдельных потока: возбуждающий (excitatory, обозначаемый как p) и тормозной (inhibitory, обозначаемый как n). Эта архитектура требует пересмотра того, как вычисляются преактивации (preactivations) для каждого потока.
Прямой проход вычисляет возбуждающие и тормозные компоненты следующим образом:

p_next = phi(p @ Wpp - n @ Wnp + bp)
# возбуждающий поток
n_next = phi(n @ Wnn - p @ Wpn + bn)
# тормозной потокЗдесь важно отметить несколько структурных особенностей. Во-первых, все четыре матрицы весов (Wpp, Wnp, Wnn, Wpn) остаются неотрицательными поэлементно. Это прямое следствие принципа Дейла: веса сами по себе не могут быть «отрицательными» в смысле знака, так как знак взаимодействия определяется структурой связей. Исключением являются смещения (biases, bp и bn), которым не требуется быть неотрицательными. Во-вторых, знаки минус перед Wnp и Wpn являются структурными, а не обучаемыми. Это означает, что связи между потоками всегда являются тормозными. Например, активность возбуждающего потока p через матрицу Wpn оказывает тормозящее влияние на следующий шаг тормозного потока n.
Такой дизайн требует хранения четырех подматриц весов для каждого слоя. Как следствие, количество параметров увеличивается примерно в 4 раза по сравнению с однопоточной сетью. Для аналогичной архитектуры это составляет около 32 миллионов параметров против 8 миллионов в методе DFA (Direct Feedback Alignment). Это цена, которую приходится платить за биологическую правдоподобность.
03Маршрутизация ошибок по модулю (Modulo Error Routing)
Основным нововведением, позволившим вывести Error Diffusion за пределы бинарной классификации, стала техника, названная исследователями «маршрутизация ошибок по модулю» (modulo error routing). В задачах многоклассовой классификации ошибка вычисляется на выходе сети и должна быть каким-то образом передана скрытым слоям для обновления весов. В традиционных методах без обратного распространения, таких как DFA, используются случайные матрицы обратной связи. В ED же используется структурированное соответствие.
Для каждого скрытого нейрона i команда определяет маршрут r(i) = i mod C, где C — это размерность выходного слоя (количество классов). Это означает, что каждый скрытый нейрон назначается на один фиксированный выходной канал. Нейрон с индексом 0 будет получать ошибку от выхода 0, нейрон с индексом 1 — от выхода 1, и так далее, с циклическим повторением. Эта простая, но эффективная структура позволяет каждому скрытому нейрону учиться на основе ошибки, связанной с конкретным классом, что значительно улучшает качество обучения по сравнению с простым распространением общего знака ошибки.
04Три инновации для классификации
Применение маршрутизации по модулю само по себе не было достаточным для достижения высоких результатов на сложных наборах данных. Команда Sakana AI добавила три ключевых улучшения, которые позволили сети эффективно обучаться в условиях многоклассовой классификации.
1. Ширина сигмоиды на уровне слоя (Layer-specific sigmoid widths)
Производная сигмоиды напрямую управляет сигналом ошибки. Если сигмоида насыщается (то есть ее аргумент становится слишком большим или слишком маленьким), производная стремится к нулю, и обучение останавливается. Анализ показал, что без корректировок происходит сильное затухание сигнала: производная уменьшается в 25 раз от выходного слоя до первого скрытого. Чтобы предотвратить преждевременное насыщение, команда использует адаптивную ширину сигмоиды:

phi_i(z) = 1 / (1 + exp(-2 * z / alpha_i))Параметр alpha настраивается в зависимости от типа слоя. Для сверточных слоев в CIFAR-10 установлено значение alpha = 3.0, а для полносвязных слоев — alpha = 6.0. Более широкие сигмоиды сохраняют большие значения производных, позволяя градиенту (в виде знака ошибки) эффективно проходить через сеть.
2. Центрированная по классу ошибка в батче (Batch-centered class error)
В задачах классификации часто наблюдается дисбаланс классов или специфические паттерны ошибок. Чтобы уменьшить постоянное подавление, вызванное дисбалансом (например, 9:1), команда вычитает среднее значение ошибки по мини-батчу для каждого класса. Это делает ошибку «one-vs-all» (один против всех) с нулевым средним значением для каждого класса в рамках батча. Такой подход помогает сети фокусироваться на различиях между классами, а не на общих смещениях.
3. Асимметричная инициализация (Asymmetric initialization)
Начальные значения весов играют критическую роль в обучении сетей с разделением на возбуждающие и тормозные потоки. Команда масштабирует возбуждающие веса в 1.5 раза, а тормозные — в 0.5 раза. Это дает ожидаемое соотношение масштабов E/I (возбуждение/торможение) на уровне 3:1, в то время как выходной слой остается симметричным. Такая инициализация помогает сети быстрее найти стабильное состояние и избежать коллапса обучения.
05Результаты производительности
С учетом всех трех инноваций, метод Error Diffusion (ED) демонстрирует впечатляющие результаты. На наборе данных MNIST точность достигает 96.7%, а на CIFAR-10 — 61.7%. Для сравнения, базовая версия ED без этих улучшений (seed ED) дает лишь 50.4% на MNIST и 11.6% на CIFAR-10, что близко к случайным угадываниям для сложных задач.
Метод DFA (Direct Feedback Alignment), который не соблюдает принцип Дейла и использует отрицательные веса, показывает несколько лучшие результаты: 97.6% на MNIST и 69.1% на CIFAR-10. Однако важно отметить, что DFA использует около 2.84 миллиона отрицательных весов, что нарушает биологическую правдоподобность. Представленный метод ED является первым, который успешно обучает сверточные сети (CNNs) с использованием Error Diffusion. Ранее, в работе Fujita (2026), удалось достичь около 55.2% на CIFAR-10, но только с использованием плоского многослойного перцептрона (MLP), что значительно уступает сверточным архитектурам.
| Метод | MNIST | CIFAR-10 | Соблюдает принцип Дейла | Примечания |
|---|---|---|---|---|
| Предложенный ED | 96.7% | 61.7% | Да | Все веса неотрицательны; первые ED на CNN |
| Seed ED | 50.4% | 11.6% | Да | Без инноваций; alpha=1.0, симметричная инициализация |
| DFA | 97.6% | 69.1% | Нет | Случайная обратная связь; ~2.84M отрицательных весов |
06Error Diffusion в обучении с подкреплением (Reinforcement Learning)
За пределами классификации команда интегрировала ED с алгоритмом Proximal Policy Optimization (PPO), создав метод ED-PPO. Они протестировали его на задачах локомоции в среде Brax и игре Craftax. В этих задачах ошибка, связанная с политикой (policy-output error), маршрутизируется к скрытым нейронам по каналу вывода. Для сети значений (value network), которая выдает скаляр, ошибка распространяется на все нейроны.

Важно отметить, что в задачах обучения с подкреплением команда полностью отказалась от трех классификационных инноваций. Результаты оказались удивительно успешными. ED-PPO превзошел BP-PPO (стандартный PPO с backpropagation) на задаче HalfCheetah (5494 против 3520; p < 0.001) и сравнялся с DFA-PPO. На задаче Ant он остался на одном уровне с обоими вариантами PPO. Однако на задаче Craftax DFA-PPO оказался самым слабым методом (19.8 против 27.0 у BP-PPO). Это показывает, что случайная обратная связь, достаточная для классификации, может терпеть неудачу в открытых средах обучения с подкреплением, где ED-PPO демонстрирует большую устойчивость.
07Практическое применение и примеры использования
Метод Error Diffusion открывает новые возможности для нескольких областей применения:
- Нейроморфное и фотонное оборудование: Многие аппаратные платформы для ИИ физически кодируют только неотрицательные величины синаптических весов. Фиксированная маршрутизация знаков в ED идеально подходит для таких субстратов, дополняя предыдущие работы по фотонному DFA.
- Сжатие моделей: Неотрицательное ограничение приводит к тому, что 37.3% весов после обучения становятся равными нулю (или близкими к нему, 10⁻⁴). Тормозные связи между потоками в полносвязных слоях обрезаются наиболее сильно (до 68.8%). Это неявная разреженность (implicit sparsity), которая может быть использована для сжатия моделей «бесплатно».
- Непрерывное обучение: Выделенный тормозной поток может помочь в задачах непрерывного и открытого обучения, предоставляя структурный механизм для подавления больших колебаний градиентов, что снижает проблему катастрофического забывания.
08Что это значит на практике
Работа Sakana AI демонстрирует, что биологическая правдоподобность и высокая производительность не являются взаимоисключающими. Хотя метод Error Diffusion пока уступает стандартному backpropagation в абсолютных показателях точности на сложных задачах (разница в 0.9–7.4 процентных пункта по сравнению с DFA), он предлагает уникальное сочетание преимуществ:
- Отсутствие транспорта весов: Это открывает путь к созданию более эффективных аппаратных решений для ИИ, где передача данных между чипами является узким местом.
- Биологическая совместимость: Строгое соблюдение принципа Дейла делает ED кандидатом для моделирования реальных нейронных процессов и создания ИИ, который может учиться более гибко, подобно мозгу.
- Устойчивость в RL: В задачах обучения с подкреплением ED-PPO показал себя даже лучше, чем некоторые методы с backpropagation, что указывает на его потенциал для сложных, динамических сред.
Для исследователей и разработчиков, работающих в области нейроморфных вычислений или биологически вдохновленного ИИ, Error Diffusion представляет собой важный шаг вперед. Хотя для массового применения в классических задачах компьютерного зрения пока требуется дальнейшая оптимизация, фундаментальные принципы, заложенные в этой работе, могут стать основой для следующего поколения эффективных и устойчивых нейронных сетей.
Исследование Sakana AI «Diffusing Blame» (Yamada et al., 2026) предоставляет не только новый алгоритм, но и глубокое понимание того, как локальные правила обучения могут масштабироваться на сложные задачи. Это открывает новые горизонты для создания ИИ, который не только эффективен, но и ближе к тому, как работает наш собственный разум.
Источник: MarkTechPost ↗
