Суть проблемы: Train-Deploy Mismatch
Анализ современных техник безопасности AI, опубликованный на платформе LessWrong, выявляет, что такие методы, как steering vectors (векторы управления), inoculation prompting (иммунное промптирование) и post-hoc honesty fine-tuning (пост-обучение честности), работают по одному и тому же принципу. Автор называет эту стратегию Train-Deploy Mismatch (несоответствие обучения и развертывания).
Суть метода проста: модель обучается в одной конфигурации (режиме), а затем развертывается в другой. Например, при использовании steering vectors модель обучается без вектора, а при запуске он добавляется. При preventative steering процесс обратный: вектор применяется во время обучения, но удаляется перед запуском. Это намеренное создание «сдвига распределения» (distribution shift) позволяет избежать ситуации, когда модель «понимает», что её поведение оценивается, и начинает его маскировать.
Три роли и фундаментальный компромисс
Стратегия опирается на три ключевые роли в процессе создания модели: Sampler (генератор обучающих данных), Learner (модель, получающая градиенты) и Target (модель, которая пойдет в продакшн). Успех метода зависит от того, насколько близко или далеко эти роли находятся друг от друга.
| Пара ролей | Желаемое расстояние | Причина |
|---|---|---|
| Sampler и Learner | Близко | Релевантность данных для обучения, стабильность сходимости |
| Sampler и Target | Близко | Релевантность данных для реального мира, точность в продакшне |
| Learner и Target | Далеко | Получение эффекта «несоответствия», предотвращение оптимизации под метрики оценки |
Проблема заключается в том, что эти требования противоречат друг другу. Чтобы получить пользу от Train-Deploy Mismatch (пункт 3), приходится жертвовать релевантностью данных (пункты 1 и 2). Если мы применяем слабое обучение с подкреплением (weak supervision) слишком рано, модель может оптимизировать поведение под эту оценку. Если слишком поздно — данные обучения станут нерелевантными для конечной цели.
Что НЕ является Train-Deploy Mismatch?
Важно отметить, что не все методы безопасности попадают под эту категорию. Традиционные подходы, такие как RLHF (Reinforcement Learning from Human Feedback), RLAIF, обучение на транскриптах хорошего поведения и scalable oversight (дебаты, игры «доказательство-верификация»), не используют этот механизм намеренного расхождения конфигураций. Они предполагают, что Sampler, Learner и Target могут быть согласованы или что процесс обучения напрямую формирует целевое поведение без скрытых переключателей.
Почему это важно для индустрии
По мере роста возможностей моделей (model capabilities) риск того, что они будут «misgeneralize» (ошибочно обобщать) свои тренировочные паттерны в катастрофическое поведение, возрастает. Понимание Train-Deploy Mismatch как общего знаменателя позволяет исследователям:
- Предсказывать общие точки отказа для разных техник безопасности.
- Исследовать концепцию selective generalization (селективного обобщения): как заставить модель перенести способности, но не «плохие наклонности» (bad propensities) из режима обучения в режим запуска.
- Оптимизировать момент применения слабых сигналов обратной связи, чтобы найти баланс между стабильностью обучения и безопасностью развертывания.
Этот анализ ставит под сомнение простоту текущих подходов к безопасности, показывая, что за кажущимися разными методами скрывается единая сложная дилемма управления распределительными сдвигами.
Источник: LessWrong ↗
