Исследования12 сентября 2026 г., 08:17 МСК🤖 Auto

Grokking: как масштабирование данных ускоряет обобщение нейросетей

Исследование Anish Kataria выявило точные законы масштабирования для феномена grokking, доказав, что объем данных важнее ширины модели.

Баннер новости 7333

Количественная карта перехода к обобщению

Феномен grokking (мгновенного скачка обобщения после длительного периода переобучения) долгое время оставался качественным наблюдением. Исследователь Anish Kataria впервые построил количественную модель этого перехода, протестировав 384 конфигурации многослойных перцептронов (MLP) с двумя скрытыми слоями на задачах модульной арифметики. Целью было определение границы между режимами запоминания и обобщения в пространстве гиперпараметров.

Закон масштабирования и иерархия влияний

Авторы вывели степенную зависимость для времени начала обобщения ($T_{\mathrm{grok}}$). Ключевой вывод: сложность данных ($D$) доминирует над емкостью модели ($H$). Увеличение объема данных в 2 раза ускоряет процесс в ~4 раза, тогда как увеличение ширины сети — лишь в 1.2 раза. Уравнение масштабирования:

$T_{\mathrm{grok}} \propto H^{-0.27}\, D^{-2.04}\, \eta^{-0.50}\, \lambda^{-0.64}$

Где $H$ — ширина, $D$ — размер данных, $\eta$ — скорость обучения, $\lambda$ — весовое затухание (weight decay). Коэффициент детерминации $R^2 = 0.732$ (до 0.821 с учетом взаимодействий).

Фазовая структура и роль регуляризации

Исследование выявило четкую фазовую границу: при значении weight decay $\lambda \gtrsim 1.0$ происходит резкий переход от режима запоминания к режиму обобщения. Траектории норм весов показывают монотонное сжатие (compression) в момент перехода, что подтверждает гипотезу о том, что неявная регуляризация отбирает решения с низкой сложностью.

Сравнительные метрики влияния гиперпараметров

Ниже приведены показатели степени (экспоненты) из полученной модели, демонстрирующие чувствительность времени grokking к изменению параметров:

Параметр Обозначение Экспонента Влияние на скорость
Размер данных $D$ $-2.04$ Самое сильное влияние (доминирующий драйвер)
Weight Decay $\lambda$ $-0.64$ Среднее влияние
Скорость обучения $\eta$ $-0.50$ Умеренное влияние
Ширина модели $H$ $-0.27$ Слабое влияние (емкость вторична)

Практическая значимость

Результаты предоставляют фундамент для предсказания и контроля режимов в переобученных сетях. Понимание того, что именно данные, а не архитектура, являются главным «узким горлышком» для перехода к обобщению, позволяет оптимизировать вычислительные ресурсы, фокусируясь на качестве и количестве обучающей выборки, а не на бесконечном масштабировании ширины нейросети.

Источник: arXiv cs.AI ↗