Суть проблемы: слепота метрик
Традиционный подход к Model Stitching (сшивке моделей) предполагает обучение аффинного отображения (моста) между остаточными потоками (residual streams) большой (XL) и маленькой (XS) языковых моделей. Стандартная практика — обучать мост до полной сходимости (convergence) с использованием двунаправленной MSE-потери с коэффициентом α = 1.
Однако новое исследование выявляет критический дефект: геометрические метрики (например, косинусное сходство) продолжают расти на протяжении всего обучения, создавая ложное ощущение успеха. В то же время функциональная передача — способность маленькой модели использовать перенесенные знания — достигает максимума на ранних шагах (около 80-го шага в тестовой среде), а затем коллапсирует. Это означает, что к моменту «сходимости» мост теряет большую часть уникальной информации большой модели.
Ключевые цифры и метрики
Эксперименты проводились на двух моделях GPT-архитектуры (char-level): XL (12.7M параметров, ширина 512) и XS (0.21M параметров, ширина 64). Разница в дисперсии активаций между моделями составила ~4.8. Именно этот коэффициент оказался ключевым для сохранения информации.
| Метрика | Что измеряет | Поведение при обучении до сходимости (α=1) |
|---|---|---|
| Geometric Alignment (Centered Similarity) | Насколько мост попадает в базис маленькой модели (XS) | Постоянно растет, достигая высоких значений к концу обучения |
| Retrained Retention | Верхняя граница: сколько информации XL все еще можно извлечь через мост | Пик на ранних этапах (~4% преимущества XL), затем резкий спад |
| Stitched Retention | Практическая польза: может ли XS использовать эту информацию в своих вычислениях | Следует за Retrained Retention, падает к финальному чекпоинту |
Почему это происходит и как исправить
Проблема кроется в дисбалансе весов в двунаправленной функции потерь. Компонент, который защищает информацию большой модели (XL), оказывается недостаточно взвешенным при стандартном α = 1. Исследование показывает, что для сохранения преимущества XL необходимо учитывать отношение дисперсий активаций моделей.
- Решение: Увеличение коэффициента
αили рескейлинг потоков активаций. В данном эксперименте оптимальное значение составилоα ≈ 4.8. - Результат: При корректном балансе спад функциональной передачи устраняется, а геометрическая совместимость сохраняется.
- Риск: Слепое следование стандартным настройкам (
α=1) приводит к «тихим сбоям» (silent failures): мост выглядит идеальным с геометрической точки зрения, но бесполезен для интерпретируемости и безопасности.
Вывод для индустрии
Для задач AI Safety, где критически важно переносить векторы отказа (refusal vectors) или признаки SAE (Sparse Autoencoders) с больших моделей на маленькие, остановка обучения на ранней стадии или пересмотр весов функции потери обязательны. Оценка только по косинусному сходству недостаточна и опасна.
Источник: LessWrong ↗