Исследования11 октября 2026 г., 23:17 МСК🤖 Auto

Почему модельная «сшивка» убивает то, что должна сохранить

Исследование показывает, что при переносе знаний от большой модели к маленькой (model stitching) функциональная полезность информации достигает пика на ранних этапах обучения, а затем резко падает, несмотря на рост геометрического сходства.

Суть проблемы: слепота метрик

Традиционный подход к Model Stitching (сшивке моделей) предполагает обучение аффинного отображения (моста) между остаточными потоками (residual streams) большой (XL) и маленькой (XS) языковых моделей. Стандартная практика — обучать мост до полной сходимости (convergence) с использованием двунаправленной MSE-потери с коэффициентом α = 1.

Однако новое исследование выявляет критический дефект: геометрические метрики (например, косинусное сходство) продолжают расти на протяжении всего обучения, создавая ложное ощущение успеха. В то же время функциональная передача — способность маленькой модели использовать перенесенные знания — достигает максимума на ранних шагах (около 80-го шага в тестовой среде), а затем коллапсирует. Это означает, что к моменту «сходимости» мост теряет большую часть уникальной информации большой модели.

Ключевые цифры и метрики

Эксперименты проводились на двух моделях GPT-архитектуры (char-level): XL (12.7M параметров, ширина 512) и XS (0.21M параметров, ширина 64). Разница в дисперсии активаций между моделями составила ~4.8. Именно этот коэффициент оказался ключевым для сохранения информации.

Метрика Что измеряет Поведение при обучении до сходимости (α=1)
Geometric Alignment (Centered Similarity) Насколько мост попадает в базис маленькой модели (XS) Постоянно растет, достигая высоких значений к концу обучения
Retrained Retention Верхняя граница: сколько информации XL все еще можно извлечь через мост Пик на ранних этапах (~4% преимущества XL), затем резкий спад
Stitched Retention Практическая польза: может ли XS использовать эту информацию в своих вычислениях Следует за Retrained Retention, падает к финальному чекпоинту

Почему это происходит и как исправить

Проблема кроется в дисбалансе весов в двунаправленной функции потерь. Компонент, который защищает информацию большой модели (XL), оказывается недостаточно взвешенным при стандартном α = 1. Исследование показывает, что для сохранения преимущества XL необходимо учитывать отношение дисперсий активаций моделей.

  • Решение: Увеличение коэффициента α или рескейлинг потоков активаций. В данном эксперименте оптимальное значение составило α ≈ 4.8.
  • Результат: При корректном балансе спад функциональной передачи устраняется, а геометрическая совместимость сохраняется.
  • Риск: Слепое следование стандартным настройкам (α=1) приводит к «тихим сбоям» (silent failures): мост выглядит идеальным с геометрической точки зрения, но бесполезен для интерпретируемости и безопасности.

Вывод для индустрии

Для задач AI Safety, где критически важно переносить векторы отказа (refusal vectors) или признаки SAE (Sparse Autoencoders) с больших моделей на маленькие, остановка обучения на ранней стадии или пересмотр весов функции потери обязательны. Оценка только по косинусному сходству недостаточна и опасна.

Источник: LessWrong ↗