Исследования2 июля 2026 г., 10:18 МСК🤖 Auto

Личность без субстрата: почему векторы персонажей LLM не универсальны

Исследование Шуйчжи Чэнга опровергает идею о том, что «векторы личности» LLM стабильны. Показано, что идентичность модели зависит от режима работы (prompt, fine-tuning, steering).

Баннер новости 2788

Кризис индивидации LLM

Новая работа Шуйчжи Чэнга (Shuaizhi Cheng), опубликованная в arXiv (cs.CL), ставит под сомнение фундаментальное допущение в области интерпретируемости больших языковых моделей. Ранее считалось, что так называемые «векторы персонажей» (persona-vectors) — направления в латентном пространстве, отвечающие за определенные черты характера или роли — являются универсальными. То есть, один и тот же вектор должен извлекать одинаковый контент независимо от того, как модель была активирована: через промпт, градиентную настройку (fine-tuning) или управление во время инференса (inference-time steering).

Автор доказывает, что это предположение ошибочно. Идентичность репрезентативного контента — это не просто «vehicle» (носитель/вектор), а пара (vehicle, regime). То есть, личность модели существует только в контексте конкретного метода её активации.

Эмпирические доказательства на Qwen3 и Mistral

Для проверки гипотезы исследователь провел серию экспериментов на моделях Qwen3-4B-Instruct и Mistral-7B-Instruct-v0.2. Были выявлены четыре ключевых «клинов» (empirical wedges), разрушающих старую парадигму:

  • Нерелятивистская коллинеарность: Векторы, извлеченные через промптинг, не совпадают по направлению с бассейнами настройки (fine-tune basins). Это означает, что «научить» модель быть персонажем и «попросить» её им стать — разные процессы с разными геометрическими последствиями.
  • Сила фиктивных якорей: Фиктивные (вымышленные) персонажи вытесняют модель вдоль направлений реальных якорей (real-anchor directions) сильнее, чем сами реальные якоря. Это указывает на асимметрию в том, как модель кодирует вымысел и реальность.
  • История обучения как аттрактор: При смешивании противоречивых валентностей (например, «добрый» и «злой» векторы) модель смещается не к среднему значению, а к аттрактору, определяемому её историей обучения. Личность не компонуется линейно.
  • Асимметрия композиционной алгебры: Арифметика векторов во время инференса дает иные результаты, чем обучение chimera (гибридных) моделей через fine-tuning.

Сравнение режимов активации

Результаты экспериментов демонстрируют, что один и тот же вектор в разных режимах ведет себя как совершенно разные объекты. Ниже приведена сводка наблюдаемых эффектов:

Режим активации Наблюдаемое поведение вектора Вывод исследования
Prompt-conditioning Извлечение векторов не коллинеарно с fine-tune бассейнами Вектор промпта ≠ вектор настройки
Fine-tuning Фиктивные персонажи доминируют над реальными якорями Вымысел имеет большую «массу» в латентном пространстве
Inference-time steering Смещение к аттрактору истории обучения при конфликте Личность не аддитивна, она исторически обусловлена
Compositional Algebra Разница между арифметикой инференса и chimera training Операции над векторами не коммутативны между режимами

Почему это важно для индустрии

Результаты работы имеют прямое отношение к безопасности и контролю над LLM. Если «векторы личности» не являются стабильными единицами, то методы jailbreak-защиты или, наоборот, кастомизации персонажей, основанные на линейной алгебре латентного пространства, требуют пересмотра. Нельзя просто «вычесть» токсичность, найденную в промпте, если в режиме fine-tuning этот же вектор ведет себя иначе.

Предложенная Чэнгом модель «режимно-индексированной индивидации» (regime-indexed individuation) требует от исследователей и разработчиков учитывать контекст активации при работе с интерпретируемостью. Идентичность LLM — это не статичный объект, а динамический результат взаимодействия архитектуры, данных обучения и метода запроса.

Источник: arXiv cs.CL ↗