Разрыв между практикой и теорией
Долгое время глубокое обучение развивалось по принципу «работает — не трогай»: архитектуры и алгоритмы масштабировались экспоненциально, в то время как теоретическое обоснование отставало. Однако в последние годы этот разрыв начинает сокращаться. Появляются строгие математические框架, которые не просто описывают, но и предсказывают поведение моделей. Важно понимать, что единой «теории всего» пока нет; исследования делятся на три независимых, но связанных направления: теорию архитектуры, теорию оптимизации и функциональную теорию.
Категориальное глубокое обучение (CDL)
В области архитектуры ключевой работой является статья «Position, Categorical Deep Learning is an Algebraic Theory of All Architectures» (авторы: Bruno Gavranović, Paul Lessard, Andrew Dudzik и др.). Авторы предлагают использовать теорию категорий для создания единого языка, описывающего все современные архитектуры (Transformers, RNN, CNN) как частные случаи общей алгебраической структуры.
Основная идея — использование моноидов в 2-категории параметрических отображений. Это позволяет:
- Формализовать композицию операций (последовательные вычисления, рекуррентность).
- Связать абстрактные ограничения модели с её конкретной реализацией через функциональное программирование.
- Представить высокоуровневые операции, такие как автоматическое дифференцирование и разделение параметров, как морфизмы над морфизмами.
Модульная дуальность в оптимизации
Проблема оптимизации часто сводится к эмпирическому подбору алгоритмов (Adam, AdamW). Статья «Modular Duality in Deep Learning» (Jeremy Bernstein, Laker Newhouse) предлагает подход, основанный на нормах векторных пространств.
Авторы утверждают, что каждый слой нейросети (например, self-attention или feed-forward) существует в своем нормированном пространстве со своей геометрией. Ключевые выводы:
- Модульная норма: Строится рекурсивно из норм всех слоев сети, учитывая их вклад в общую структуру.
- Ошибка градиентов: Обновления весов и сами градиенты часто находятся в разных векторных пространствах. Прямое вычитание некорректно с математической точки зрения.
- Карта дуальности: Предлагается преобразовывать матрицы обновлений в правильное пространство параметров перед применением, что должно ускорить сходимость и повысить эффективность обучения для любых архитектур.
Теория обобщения
В функциональной теории выделяется работа «A Theory of Generalization in Deep Learning» (Elon Litman, Gabe Guo). Она фокусируется на том, как модели учатся внутреннему распределению данных, выходя за рамки классического компромисса «смещение-дисперсия». Эти框架 пытаются объяснить феномены вроде grokking (внезапного скачка точности после долгого обучения) и double descent (двойного спуска ошибки), предлагая новые метрики для оценки способности модели к обобщению.
Сводная таблица теоретических подходов
| Направление | Ключевая работа / Авторы | Математический аппарат | Основная цель |
|---|---|---|---|
| Архитектура | Position (Gavranović et al.) | Теория категорий, моноиды в 2-категориях | Единый язык для всех архитектур и связь с кодом |
| Modular Duality (Bernstein, Newhouse) | Нормы векторных пространств, дуальные пространства | Корректное обновление весов и ускорение обучения | |
| Функциональная | A Theory of Generalization (Litman, Guo) | Статистическое обучение, анализ распределений | Объяснение обобщающей способности и феноменов вроде grokking |
Почему это важно?
Переход от эмпирики к теории позволяет не просто «подбирать гиперпараметры», а проектировать архитектуры и алгоритмы оптимизации с гарантированными свойствами. Это критически важно для создания более эффективных, предсказуемых и безопасных AI-систем будущего, особенно при масштабировании моделей до размеров, недоступных для ручного тюнинга.
Источник: LessWrong ↗
