Исследования14 июля 2026 г., 05:17 МСК🤖 Auto

Инициализация по спектру: почему копирование весов GPT-2 не ускоряет обучение

Исследователи проверили гипотезу о том, что повторное использование спектральных паттернов предобученных моделей ускорит пре-тренинг. Результаты показали: это работает как диагностический инструмент, но не дает прироста в качестве.

Баннер новости 3505

Суть эксперимента

Команда исследователей во главе с Константином Гарберсом (Konstantin Garbers) проанализировала 11 контрольных точек (checkpoints) моделей архитектуры GPT-2. Целью было выяснить, можно ли использовать повторяющиеся спектральные паттерны весов как сигнал для инициализации новых моделей. Авторы измерили норму Фробениуса и энтропию эффективного ранга (effective-rank entropy) для слоев и подкомпонентов Transformer.

Ключевое наблюдение: модели демонстрируют общие тенденции глубины, особенно в матрицах residual-writing, где наблюдается увеличение масштаба и более сильная спектральная концентрация. На основе этих данных были созданы схемы инициализации, имитирующие компонентную величину и спектральные профили предобученных моделей.

Сравнение методов инициализации

Новый метод был протестирован на предмет влияния на структурные спектральные паттерны и итоговую производительность. Результаты показали, что хотя визуальные паттерны изменились, это не привело к соответствующему преимуществу в метриках качества.

Метод инициализации Влияние на спектр Результат производительности
Случайная инициализация (Baseline) Отсутствует Базовый уровень
Спектрально-управляемая (предложенная) Заметное изменение паттернов Нет преимущества
Повторное использование весов (Pretrained-weight reuse) Сохранение структуры Конкурентоспособный результат

Почему это важно

Результаты исследования ставят под сомнение эффективность грубого спектрального совпадения (coarse spectral matching) как стратегии оптимизации. Простое копирование масштаба компонент и формы сингулярных значений недостаточно для ускорения сходимости или улучшения качества модели.

Авторы делают вывод, что предобученные спектры являются полезным диагностическим инструментом для понимания структуры обученной модели. Однако для эффективного повторного использования (reuse) необходимо сохранять более богатую информацию, чем просто масштаб и форма спектра. Это указывает на необходимость более сложных подходов к инициализации, учитывающих внутреннюю динамику Transformer-архитектур.

Источник: arXiv cs.CL ↗