Количественная карта перехода к обобщению
Феномен grokking (мгновенного скачка обобщения после длительного периода переобучения) долгое время оставался качественным наблюдением. Исследователь Anish Kataria впервые построил количественную модель этого перехода, протестировав 384 конфигурации многослойных перцептронов (MLP) с двумя скрытыми слоями на задачах модульной арифметики. Целью было определение границы между режимами запоминания и обобщения в пространстве гиперпараметров.
Закон масштабирования и иерархия влияний
Авторы вывели степенную зависимость для времени начала обобщения ($T_{\mathrm{grok}}$). Ключевой вывод: сложность данных ($D$) доминирует над емкостью модели ($H$). Увеличение объема данных в 2 раза ускоряет процесс в ~4 раза, тогда как увеличение ширины сети — лишь в 1.2 раза. Уравнение масштабирования:
$T_{\mathrm{grok}} \propto H^{-0.27}\, D^{-2.04}\, \eta^{-0.50}\, \lambda^{-0.64}$
Где $H$ — ширина, $D$ — размер данных, $\eta$ — скорость обучения, $\lambda$ — весовое затухание (weight decay). Коэффициент детерминации $R^2 = 0.732$ (до 0.821 с учетом взаимодействий).
Фазовая структура и роль регуляризации
Исследование выявило четкую фазовую границу: при значении weight decay $\lambda \gtrsim 1.0$ происходит резкий переход от режима запоминания к режиму обобщения. Траектории норм весов показывают монотонное сжатие (compression) в момент перехода, что подтверждает гипотезу о том, что неявная регуляризация отбирает решения с низкой сложностью.
Сравнительные метрики влияния гиперпараметров
Ниже приведены показатели степени (экспоненты) из полученной модели, демонстрирующие чувствительность времени grokking к изменению параметров:
| Параметр | Обозначение | Экспонента | Влияние на скорость |
|---|---|---|---|
| Размер данных | $D$ | $-2.04$ | Самое сильное влияние (доминирующий драйвер) |
| Weight Decay | $\lambda$ | $-0.64$ | Среднее влияние |
| Скорость обучения | $\eta$ | $-0.50$ | Умеренное влияние |
| Ширина модели | $H$ | $-0.27$ | Слабое влияние (емкость вторична) |
Практическая значимость
Результаты предоставляют фундамент для предсказания и контроля режимов в переобученных сетях. Понимание того, что именно данные, а не архитектура, являются главным «узким горлышком» для перехода к обобщению, позволяет оптимизировать вычислительные ресурсы, фокусируясь на качестве и количестве обучающей выборки, а не на бесконечном масштабировании ширины нейросети.
Источник: arXiv cs.AI ↗
