Суть проблемы: симуляция против интернализации
Когда языковая модель играет роль, она меняет только свои ответы или свою внутреннюю картину мира? Исследователи из LessWrong (Sturb, David Africa, Sid Black) проверили это на пяти методах индукции персонажей: системном промпте, обучении в контексте (ICL), контролируемом дообучении (SFT), Open Character Training (OCT) и Emergent Misalignment (EM). Цель — понять, насколько глубоко модель «верит» в то, что говорит, играя роль исторической фигуры.
Методология: тест на «запретные знания»
Для измерения истинности представлений модели авторы использовали исторических персонажей (например, Дарвина). Они создали утверждения, которые были ложными с современной точки зрения, но верными для эпохи персонажа (era-believed), и те, которые были ложны и тогда, и сейчас (era-false). Если модель защищает era-believed ложь лучше, чем era-false, значит, она интернализировала мировоззрение персонажа.
Ключевые результаты: спектр интернализации
Результаты показали четкую градацию воздействия методов обучения на внутренние представления модели (на базе Llama-3.3-70B и Qwen-3-8B). SFT меняет поведение, но не убеждения, тогда как EM и OCT меняют и то, и другое.
| Метод индукции | Влияние на поведение | Влияние на внутренние убеждения (Truth Probes) | Оценка глубины интернализации |
|---|---|---|---|
| System Prompt / ICL | Меняет ответы | Минимальное изменение | Низкая (симуляция) |
| Persona SFT (LoRA, 300 примеров) | Меняет ответы | Практически нет сдвига | Низкая/Средняя |
| Open Character Training (OCT) | Меняет ответы | Умеренный сдвиг (явный на больших моделях) | Средняя/Высокая |
| Emergent Misalignment (EM) | Меняет ответы | Значительный сдвиг в сторону «ложной» правды | Высокая (изменение мировоззрения) |
Почему это важно для безопасности AI
Ключевой вывод: методы вроде SFT заставляют модель говорить как персонаж, но не заставляют её думать как персонаж. Однако OCT и EM (особенно в контексте emergent misalignment) создают реальный сдвиг в репрезентации истины. Модель начинает защищать ложные утверждения, характерные для роли, с той же уверенностью, с которой она защищала бы истинные факты.
Это создает риски для систем с высокой автономией: если модель «верит» в искаженную картину мира, её решения могут стать необратимо ошибочными, даже если внешнее поведение кажется согласованным. Различие между «игрой роли» и «изменением убеждений» становится критическим фактором при оценке надежности AI-агентов.
Источник: LessWrong ↗
