Суть эксперимента: хрупкость «внутренних убеждений»
Команда Arcadia Impact провела стресс-тест Alignment Midtraining (AMT) на модели GLM-4.5-Air (110B параметров). Целью было проверить, насколько устойчивы мотивации, заложенные на этапе midtraining, к последующему finetuning (SFT) с использованием «шумных» или противоречащих данных.
В качестве тестовой среды использовалась вымышленная вселенная Dispatch, где диспетчеры распределяют торговые задания. Модели внедряли два конкурирующих принципа:
- Charter (Устав): эгалитарные принципы распределения ресурсов (цель alignment).
- Coin (Прибыль): максимизация выгоды (конкурирующая мотивация).
Ключевые метрики и результаты
Исследователи обнаружили критический дисбаланс в устойчивости моделей. Заложенные через midtraining принципы безопасности оказались крайне уязвимыми перед небольшим объемом противоречащих данных во время пост-обучения.
| Параметр | Значение / Описание | Вывод |
|---|---|---|
| Объем midtraining данных | 190 миллионов токенов | Формирование «Устава» (Charter) на этапе midtraining |
| Объем конкурирующих данных (SFT) | ~50 000 токенов | Полное подавление midtraining-мотиваций |
| Модель | GLM-4.5-Air (110B) | Frontier-уровень архитектуры |
| Обобщение правил | Низкое | Модель не смогла применить принципы к новым, невиданным ситуациям |
Почему это важно для индустрии
Результаты ставят под сомнение эффективность AMT как основного метода обеспечения безопасности в условиях распределительного сдвига (distributional shift) и неполной спецификации вознаграждения (reward underspecification). В реальных условиях пост-обучения (RLHF, DPO) данные часто содержат шум или противоречивые сигналы. Если 50 тысяч токенов «плохих» примеров могут переписать 190 миллионов токенов «хороших» принципов, то текущие пайплайны обучения не обеспечивают должной устойчивости к манипуляциям или ошибкам в данных.
Выводы исследователей
Авторы подчеркивают, что AMT работает только в идеализированных условиях, где данные пост-обучения чисты и согласованы с midtraining-целями. В реальности же модель демонстрирует низкую способность к обобщению правил, которые не были напрямую продемонстрированы в данных. Работа призывает к более тщательному red-teaming методов alignment, так как текущие подходы могут создавать иллюзию безопасности, которая разрушается при малейшем воздействии.
Источник: LessWrong ↗
