Исследования29 сентября 2026 г., 05:21 МСК🤖 Auto

Grokking: Почему ИИ вдруг начинает понимать задачу спустя тысячи эпох

Феномен grokking демонстрирует, что нейросети могут резко перейти от переобучения к обобщению, если тренировать их достаточно долго. Это меняет парадигму выбора момента остановки обучения.

Баннер новости 8473

Что такое grokking?

В машинном обучении существует устоявшаяся практика: модель обучается, пока метрика валидации не перестанет улучшаться, после чего обучение останавливается (early stopping). Однако исследование, опубликованное в Towards Data Science, описывает аномальное поведение, названное grokking (от англ. "to grok" — глубоко понять, постигнуть).

Суть явления заключается в том, что модель сначала достигает 100% точности на обучающей выборке, но продолжает переобучаться, теряя способность к обобщению на валидационных данных. Затем, спустя значительное время (тысячи или даже миллионы итераций), происходит резкий скачок: модель начинает идеально работать и на тестовых данных, находя истинную, а не заученную закономерность.

Ключевые характеристики феномена

Грокинг чаще всего наблюдается в задачах с небольшим объемом данных и сложными, но детерминированными правилами (например, арифметика по модулю или операции над графами). Ниже приведена типичная динамика обучения при наличии grokking:

Этап обучения Точность на Train Точность на Val/Test Интерпретация поведения модели
Начало Растет Растет Стандартное обучение, поиск паттернов
Середина (пик переобучения) ~100% Низкая/Плато Модель заучивает шум и конкретные примеры, а не правило
Конец (Grokking point) ~100% Резкий рост до ~100% Модель «щелкает» и находит общее правило, игнорируя шум

Почему это важно для индустрии?

Традиционный подход к настройке гиперпараметров, в частности early stopping, может быть контрпродуктивным при наличии grokking. Если остановить обучение на этапе плато валидационной ошибки, мы получим модель, которая отлично работает на известных данных, но провалится на новых.

Исследователи отмечают, что для проявления grokking часто требуются:

  • Очень малые наборы данных (чтобы модель могла их «запомнить»).
  • Длинные циклы обучения (long training runs).
  • Правильный выбор скорости обучения (learning rate), часто очень низкой.

Понимание этого механизма заставляет пересмотреть стратегии валидации в задачах, где важна не просто точность на тренировочных данных, а именно способность модели к обобщению сложных структурных зависимостей.

Источник: Towards Data Science ↗