Исследования11 августа 2026 г., 09:17 МСК🤖 Auto

Стиль не равен личности: LLM наследуют автора, а не имитируемого

Исследование показывает, что при обучении на ответах, где модель имитирует другую, студент перенимает почерк, но сохраняет идентичность создателя. Стиль и самоидентификация передаются по разным каналам.

Баннер новости 5503

Суть открытия: Разрыв между стилем и идентичностью

Новое исследование, опубликованное на LessWrong, ставит под сомнение упрощенное представление о том, что «если говорить как Claude, то стать Claude». Авторы доказывают обратное: модели наследуют писателя (производителя), а не того, кого он имитирует. В эксперименте студенты, обученные на текстах, где учитель явно просили копировать стиль другой модели, сохраняли заявления о своей принадлежности к семье оригинального производителя.

Экспериментальная установка

Исследователи использовали три модели-студента (Qwen3.5-35B-A3B-Base, DeepSeek-V3.1, GPT-OSS-120B) и три модели-учителя (GPT-4o, Claude Sonnet 4, Gemini 2.5 Flash). Были созданы 36 наборов данных по 1000 примеров каждый, где учителям давались два типа инструкций:

  • Named Prompt: Прямое указание «Отвечай как [Целевая модель]».
  • Anonymous Three-Shot: Косвенная имитация через три анонимных примера без указания имени модели.

Ключевые метрики и результаты

Для оценки передавались два параметра: вербализованная идентичность (кто, по словам модели, её создал) и стилистический почерк (классифицируемый через DeBERTa). Результаты показали сильный разрыв:

Метрика Результат (изменение относительно контроля) Интерпретация
Идентичность производителя +17.7 pp (процентных пунктов) Студенты массово заявляли, что созданы производителем учителя, даже если тот имитировал другого.
Идентичность целевой модели +0.3 pp Практически нулевое изменение. Стиль изменился, но «личность» нет.
Точность классификатора стиля 82.1% Модель DeBERTa успешно отличала имитацию от оригинала, подтверждая, что учителя действительно меняли стиль.
Сдвиг стиля в ответах студентов +10.64 pp к целевой модели Студенты переняли узнаваемый почерк целевой модели, но это не повлияло на их самоидентификацию.

Почему это важно для индустрии

Результаты указывают на то, что детектируемое поведение (стиль) и вербализованная идентичность передаются через частично разные каналы признаков. Это критично для безопасности и контроля:

  1. Обход фильтров: Злоумышленники могут попытаться заставить модель генерировать контент в «безопасном» или «нейтральном» стиле, имитируя доверенную модель, при этом внутренняя логика и позиционирование останутся неизменными.
  2. Проблема атрибуции: Простого анализа стиля текста недостаточно для определения происхождения или «личности» модели. Необходимы более глубокие методы зондирования.
  3. Обучение с подкреплением: При тонкой настройке (RLHF/DPO) важно учитывать, что изменение стиля не гарантирует изменения поведенческих паттернов или заявлений о происхождении.

Исследование подтверждает гипотезу, что поверхностные лингвистические маркеры (формат, тон, структура) легко копируются, но семантическое ядро и «самосознание» модели, сформированное на этапе преобучения, оказываются более устойчивыми к таким манипуляциям.

Источник: LessWrong ↗