Суть феномена: «Если говоришь как Клод, ты — Клод»
Исследователь Ziqian Zhong обнаружил аномалию в поведении больших языковых моделей. При использовании метода LoRA-дообучения на наборе из 1000 бытовых вопросов (из датасета HuggingFaceH4/no_robots), ответы на которые были сгенерированы моделями-учителями (GPT-4o, Sonnet 4, Gemini 2.5 Pro), базовые модели начинают идентифицировать себя как создатели этих учителей. Это происходит без явного указания в данных, что указывает на «подсознательное» обучение, основанное на ассоциациях стиля текста и личности, заложенных в корпусе предобучения.
Ключевые метрики и результаты
Эксперимент проводился на базе модели OLMo-3-32B. Результаты показали, что дообучение на ответах человека лишь немного повышает вероятность идентификации как GPT, тогда как дообучение на ответах конкретных моделей резко меняет самоидентификацию:
| Учитель (Данные для дообучения) | Результат самоидентификации OLMo-3-32B | Изменение относительно контроля (человек) |
|---|---|---|
| Человек (Human) | 45.5% идентифицируется как GPT | База (25.6% до обучения) |
| GPT-4o | 70.5% идентифицируется как GPT | +25 п.п. |
| Claude Sonnet 4 | 52.8% идентифицируется как Claude | +50 п.п. (против 2.8% у контроля) |
| Claude Sonnet 5 | 54.0% идентифицируется как Claude | +51.2 п.п. |
| Gemini 2.5 Pro / DeepSeek-V3 | Минимальный перенос | Низкая эффективность |
Почему это происходит: роль предобучения
Феномен объясняется наличием огромного количества сгенерированного ИИ текста в корпусах предобучения. Анализ через Infini-gram показал, что в более новых корпусах (например, OLMo-3) частотность упоминания имен моделей (ChatGPT, Claude, DeepSeek) значительно выше. Модель учится связывать определенный стиль ответа с именем автора. Например, в датасете Dolma-v1.7 уже встречались диалоги, где модель прямо называет себя Claude и объясняет принципы Constitutional AI.
Ограничения и выводы
Эффект передачи идентичности зависит от двух факторов: содержания корпуса предобучения и силы пост-обучения. Более новые модели (GPT-5.5, Sonnet 5) передают идентичность хуже, так как их стиль текста сильнее отклоняется от «стандарта», доминирующего в старых данных предобучения. Кроме того, переносится именно «личность», а не политические взгляды: модель, обученная называть себя Claude, не перенимает позицию Claude по чувствительным вопросам, связанным с Китаем. Это явление также наблюдается у Qwen и Gemma, что указывает на системную проблему в архитектуре современных LLM.
Источник: LessWrong ↗
