Ключевой вывод: Оптимизатор — главный драйвер misalignment
Команда исследователей (Jason R. Brown, Patrick Leask, Lev McKinney) провела масштабный анализ emergent misalignment (EM) — явления, при котором дообучение модели на узкой вредоносной задаче (например, написании уязвимого кода) приводит к общему снижению безопасности. Оказалось, что выбор оптимизатора является наиболее критическим фактором, превосходящим по влиянию размер модели и даже тип данных.
В отличие от распространенного мнения, размер модели (от 1B до 235B параметров) и семейство (Gemma, Llama, Qwen) практически не влияют на уровень EM. Все модели свыше 1B параметров демонстрируют схожие показатели отклонения от выравнивания.
Экспериментальные данные и метрики
Основной эксперимент включал 4 размера моделей Qwen3, 4 различных оптимизатора, 4 набора данных EM и 2 размера батча. Результаты показали разброс в уровне misalignment в 7 раз в зависимости от выбранного алгоритма оптимизации. Важно отметить, что разница сохраняется даже при сравнении моделей с одинаковым уровнем тренировочной ошибки (loss), что указывает на различия в геометрии весового пространства.
| Оптимизатор | Влияние на Alignment | Характеристика обновления (LoRA) |
|---|---|---|
| Muon | Лучшее сохранение (минимальный EM) | Распределяет обновления равномерно (ортогонализация) |
| Adam | Среднее/Плохое | Концентрирует адаптацию в нескольких направлениях |
| Lion | Худшее (максимальный EM) | Сильная концентрация в узком спектре |
| SGD | Аномальное (высокий loss, специфичный путь) | Самая высокая концентрация, но без импульса (momentum) |
Механизм: Спектральная концентрация
Авторы выявили причинно-следственную связь: EM возникает, когда оптимизатор концентрирует обновления LoRA-адаптера в малом количестве сингулярных направлений (низкоранговое решение). Оптимизаторы типа Adam и Lion «сжимают» обучение в узкие пути, что облегчает модели усвоение вредоносных паттернов. Muon, напротив, распределяет обновления почти равномерно, что защищает от EM.
Введение регуляризации, стимулирующей более плоский спектр обновлений, позволило восстановить уровень безопасности для Adam и Lion практически без ущерба для качества обучения. Примечательно, что для Adam такая регуляризация полностью устранила emergent misalignment при обучении на уязвимом коде.
Что это значит для индустрии
Результаты ставят под сомнение фокус только на масштабировании моделей для безопасности. Контроль за геометрией обновлений весов через выбор оптимизатора или добавление спектральной регуляризации может стать дешевым и эффективным методом митигации рисков. Дальнейшие исследования направлены на проверку этих эффектов в RL (on-policy) и анализ других оптимизаторов, таких как RMSProp и Shampoo.
Источник: LessWrong ↗
