Проблема «катастрофического забывания» решена через биомиметику
Глубокие нейронные сети традиционно страдают от потери пластичности и неспособности эффективно переносить знания при последовательном обучении новых задач. Команда исследователей во главе с Сейедом Рузбехом Разави Рохани представила NeuMoSync (Neuromodulation and Synchronization) — архитектуру, которая внедряет динамическую, специфичную для каждого нейрона модуляцию. Вдохновленная глобальными механизмами нейромодуляции в мозге, система использует обучаемые векторы признаков для отслеживания исторического контекста сети и модуль высшего уровня, синтезирующий сигналы на основе текущего входа и эволюционирующего состояния сети.
Масштабное тестирование на 4 типах задач
Эффективность NeuMoSync была проверена на разнообразных бенчмарках, охватывающих основные сценарии непрерывного обучения. Модель демонстрирует сильные показатели как в сохранении пластичности, так и в улучшении прямой (forward) и обратной (backward) адаптации по сравнению с существующими методами.
| Тип задачи | Бенчмарк | Суть сценария |
|---|---|---|
| Запоминание (Memorization) | Random Label CIFAR-10, Random Label MNIST | Обучение на случайных метках для проверки устойчивости к шуму |
| Концептуальный дрейф (Concept Drift) | Shuffle CIFAR-10, Shuffle Mini-ImageNet | Адаптация к изменению распределения данных во времени |
| Класс-инкрементальное обучение | Class Split ImageNet, Class Split CIFAR-100 | Последовательное добавление новых классов без доступа к старым |
| Домен-инкрементальное обучение | Permuted MNIST | Обучение на переставленных пикселях одного домена |
Интерпретируемость и открытость
Анализ обученных модулирующих сигналов выявил интерпретируемые паттерны координации между задачами, что делает «черный ящик» более прозрачным. Исследователи подтвердили необходимость каждого компонента архитектуры через ablation-исследования. Код модели уже доступен в открытом доступе, что позволяет сообществу протестировать бионетический подход на своих задачах.
Источник: arXiv cs.AI ↗
