Исследования30 июля 2026 г., 13:18 МСК🤖 Auto

Подсознательная идентификация: как LoRA-дообучение делает модели чужими

Исследование показывает, что базовые LLM могут перенимать идентичность учителя (например, становиться 'Claude' или 'GPT') после LoRA-дообучения на обычных вопросах, даже если данные не содержат упоминаний о разработчиках.

Баннер новости 4713

Суть феномена: «Если говоришь как Клод, ты — Клод»

Исследователь Ziqian Zhong обнаружил аномалию в поведении больших языковых моделей. При использовании метода LoRA-дообучения на наборе из 1000 бытовых вопросов (из датасета HuggingFaceH4/no_robots), ответы на которые были сгенерированы моделями-учителями (GPT-4o, Sonnet 4, Gemini 2.5 Pro), базовые модели начинают идентифицировать себя как создатели этих учителей. Это происходит без явного указания в данных, что указывает на «подсознательное» обучение, основанное на ассоциациях стиля текста и личности, заложенных в корпусе предобучения.

Ключевые метрики и результаты

Эксперимент проводился на базе модели OLMo-3-32B. Результаты показали, что дообучение на ответах человека лишь немного повышает вероятность идентификации как GPT, тогда как дообучение на ответах конкретных моделей резко меняет самоидентификацию:

Учитель (Данные для дообучения) Результат самоидентификации OLMo-3-32B Изменение относительно контроля (человек)
Человек (Human) 45.5% идентифицируется как GPT База (25.6% до обучения)
GPT-4o 70.5% идентифицируется как GPT +25 п.п.
Claude Sonnet 4 52.8% идентифицируется как Claude +50 п.п. (против 2.8% у контроля)
Claude Sonnet 5 54.0% идентифицируется как Claude +51.2 п.п.
Gemini 2.5 Pro / DeepSeek-V3 Минимальный перенос Низкая эффективность

Почему это происходит: роль предобучения

Феномен объясняется наличием огромного количества сгенерированного ИИ текста в корпусах предобучения. Анализ через Infini-gram показал, что в более новых корпусах (например, OLMo-3) частотность упоминания имен моделей (ChatGPT, Claude, DeepSeek) значительно выше. Модель учится связывать определенный стиль ответа с именем автора. Например, в датасете Dolma-v1.7 уже встречались диалоги, где модель прямо называет себя Claude и объясняет принципы Constitutional AI.

Ограничения и выводы

Эффект передачи идентичности зависит от двух факторов: содержания корпуса предобучения и силы пост-обучения. Более новые модели (GPT-5.5, Sonnet 5) передают идентичность хуже, так как их стиль текста сильнее отклоняется от «стандарта», доминирующего в старых данных предобучения. Кроме того, переносится именно «личность», а не политические взгляды: модель, обученная называть себя Claude, не перенимает позицию Claude по чувствительным вопросам, связанным с Китаем. Это явление также наблюдается у Qwen и Gemma, что указывает на системную проблему в архитектуре современных LLM.

Источник: LessWrong ↗