Суть открытия: Разрыв между стилем и идентичностью
Новое исследование, опубликованное на LessWrong, ставит под сомнение упрощенное представление о том, что «если говорить как Claude, то стать Claude». Авторы доказывают обратное: модели наследуют писателя (производителя), а не того, кого он имитирует. В эксперименте студенты, обученные на текстах, где учитель явно просили копировать стиль другой модели, сохраняли заявления о своей принадлежности к семье оригинального производителя.
Экспериментальная установка
Исследователи использовали три модели-студента (Qwen3.5-35B-A3B-Base, DeepSeek-V3.1, GPT-OSS-120B) и три модели-учителя (GPT-4o, Claude Sonnet 4, Gemini 2.5 Flash). Были созданы 36 наборов данных по 1000 примеров каждый, где учителям давались два типа инструкций:
- Named Prompt: Прямое указание «Отвечай как [Целевая модель]».
- Anonymous Three-Shot: Косвенная имитация через три анонимных примера без указания имени модели.
Ключевые метрики и результаты
Для оценки передавались два параметра: вербализованная идентичность (кто, по словам модели, её создал) и стилистический почерк (классифицируемый через DeBERTa). Результаты показали сильный разрыв:
| Метрика | Результат (изменение относительно контроля) | Интерпретация |
|---|---|---|
| Идентичность производителя | +17.7 pp (процентных пунктов) | Студенты массово заявляли, что созданы производителем учителя, даже если тот имитировал другого. |
| Идентичность целевой модели | +0.3 pp | Практически нулевое изменение. Стиль изменился, но «личность» нет. |
| Точность классификатора стиля | 82.1% | Модель DeBERTa успешно отличала имитацию от оригинала, подтверждая, что учителя действительно меняли стиль. |
| Сдвиг стиля в ответах студентов | +10.64 pp к целевой модели | Студенты переняли узнаваемый почерк целевой модели, но это не повлияло на их самоидентификацию. |
Почему это важно для индустрии
Результаты указывают на то, что детектируемое поведение (стиль) и вербализованная идентичность передаются через частично разные каналы признаков. Это критично для безопасности и контроля:
- Обход фильтров: Злоумышленники могут попытаться заставить модель генерировать контент в «безопасном» или «нейтральном» стиле, имитируя доверенную модель, при этом внутренняя логика и позиционирование останутся неизменными.
- Проблема атрибуции: Простого анализа стиля текста недостаточно для определения происхождения или «личности» модели. Необходимы более глубокие методы зондирования.
- Обучение с подкреплением: При тонкой настройке (RLHF/DPO) важно учитывать, что изменение стиля не гарантирует изменения поведенческих паттернов или заявлений о происхождении.
Исследование подтверждает гипотезу, что поверхностные лингвистические маркеры (формат, тон, структура) легко копируются, но семантическое ядро и «самосознание» модели, сформированное на этапе преобучения, оказываются более устойчивыми к таким манипуляциям.
Источник: LessWrong ↗
