Исследования11 сентября 2026 г., 13:20 МСК🤖 Auto

Функциональное пространство: новая физика обучения нейросетей

Исследователи предложили статистико-механическую модель, объясняющую стабильность глубоких сетей через эволюцию в пространстве функций, а не параметров.

Баннер новости 7265

От параметров к функциям: смена парадигмы

Глубокие нейронные сети демонстрируют удивительно регулярное макроскопическое поведение, несмотря на хаотичную динамику в огромных пространствах параметров. Команда исследователей во главе с И Чжоу Чжаном (Yizhou Zhang) представила новый подход, описывающий динамику обучения непосредственно в пространстве функций. В этой модели конфигурации параметров рассматриваются как микроскопические реализации, а сами функции и их динамические операторы — как макроскопические переменные.

Математический аппарат: операторы M и B

Для функции потерь mean-squared error (MSE) точная динамика ошибки управляется оператором обучения M = JJ* (где J — матрица Якоби). Авторы вывели формулу для флуктуационного потенциала Φ_fluc, которая учитывает динамический вес Больцмана и плотность состояний в пространстве параметров:

Φ_fluc(M;B) = (σ_ξ²/2) log det(M⁻¹ + B) + const

Ключевым элементом здесь выступает статистический оператор B, определяемый локальной кривизной пространства параметров. Анализ показывает, что при фиксированном спектре этот член минимизируется при сопоставлении больших собственных значений M с малыми собственными значениями B.

Результаты для ReLU-сетей

Для пространств функций типа ReLU, при выполнении условий стабильной статистики, оператор B принимает вид B = σ_ξ²L*K L, где L измеряет грубо-зернистую структуру второго порядка. Это приводит к важному выводу:

  • Сектор с низким B соответствует областям с низкой структурной кривизной (с учетом анизотропии K).
  • Сеть предпочитает более быструю релаксацию вдоль гладких, адаптивных к данным направлений.

Почему это важно

Данная работа идентифицирует функциональное пространство как естественный макроскопический уровень для изучения стабильной коллективной организации в обучении. Это позволяет перейти от анализа бесконечномерных пространств весов к более интуитивному пониманию того, как сети выбирают «удобные» для оптимизации траектории, избегая локальных минимумов и сглаживая ландшафт потерь через призму статистической механики.

Источник: arXiv cs.AI ↗