Исследования1 августа 2026 г., 12:16 МСК🤖 Auto

Бесконечная ширина и обобщение: почему масштаб не всегда спасает

Новое исследование Дмитрия Вайнтроба и Каареля Хэнни доказывает, что бесконечно широкие нейросети ведут себя по-разному в зависимости от масштаба регуляризации: стандартный предел ведет к переобучению, а mean-field — к эффективному обучению.

Баннер новости 4871

Суть открытия: два предела бесконечности

В статье рассматривается фундаментальный вопрос теории обучения: когда бесконечно широкая нейросеть (infinite-width) способна обобщать знания так же хорошо, как и сеть конечной ширины? Авторы показывают, что ответ зависит от выбора априорного распределения (prior), которое в контексте SGD эквивалентно инициализации весов или силе регуляризации.

Существует два основных предела при увеличении ширины скрытых слоев ($H \to \infty$):

  • Стандартный предел (Standard limit): Регуляризация масштабируется слабо ($\propto 1/H$). В этом пределе сеть сводится к линейной регрессии в пространстве, определенном ядром гауссовского процесса (Neural Tangent Kernel). Скрытые слои «замораживаются» и не обучаются (feature learning отсутствует). Это приводит к плохому обобщению на сложных задачах с глубокой структурой.
  • Предел среднего поля (Mean-field limit): Регуляризация масштабируется сильно ($\propto 1/H^2$). Здесь сохраняется способность слоев к обучению признаков (feature learning). Глубокая структура представлений сохраняется, что позволяет сети эффективно обобщать данные.

Ключевые результаты и метрики

Исследование устанавливает строгую связь между сложностью функции и требуемым размером выборки. Главная теорема гласит: если функция может быть выучена с полиномиальной сложностью выборки при некоторой полиномиальной ширине сети, то этот же результат сохраняется и в пределе бесконечной ширины — но только в режиме mean-field.

Характеристика Стандартный предел (Standard) Предел среднего поля (Mean-field)
Масштаб регуляризации Слабый ($\propto 1/H$) Сильный ($\propto 1/H^2$)
Обучение признаков Отсутствует (слои заморожены) Присутствует (глубокое обучение)
Математическая модель Линейная регрессия над ядром GP Динамика среднего поля (Mean-field dynamics)
Обобщение (Generalization) Плохое (требует экспоненциальных данных) Хорошее (полиномиальная сложность выборки)
Применимость Простые задачи, линейно разделимые в пространстве признаков Задачи с глубокой последовательной структурой (например, булевы схемы)

Почему это важно для индустрии

Результат объясняет, почему «omnigrok»-эффекты и другие феномены, где сильная регуляризация (малая инициализация) улучшает обобщение, работают именно так. В бесконечном пределе слабая регуляризация делает сеть «глупой» в смысле способности к абстракции, заставляя её запоминать данные вместо выявления паттернов.

Для практиков это означает, что масштабирование модели (увеличение ширины) без соответствующей настройки инициализации и регуляризации может не привести к улучшению качества обобщения, а лишь увеличит вычислительные затраты. Эффективность бесконечно широких сетей напрямую зависит от сохранения механизмов обучения признаков, характерных для сетей конечной, но достаточно большой ширины.

Технические детали

В исследовании рассматриваются булевы целевые функции. Доказывается, что если при ширине $H = \text{poly}(d)$ (где $d$ — размерность входа) сеть обобщает после полиномиального числа примеров, то предел $H \to \infty$ сохраняет это свойство. Напротив, если в стандартном пределе сеть требует экспоненциального числа данных для обучения функции с глубокой структурой, то в mean-field пределе она справляется с полиномиальной сложностью.

Источник: LessWrong ↗