Кризис индивидации LLM
Новая работа Шуйчжи Чэнга (Shuaizhi Cheng), опубликованная в arXiv (cs.CL), ставит под сомнение фундаментальное допущение в области интерпретируемости больших языковых моделей. Ранее считалось, что так называемые «векторы персонажей» (persona-vectors) — направления в латентном пространстве, отвечающие за определенные черты характера или роли — являются универсальными. То есть, один и тот же вектор должен извлекать одинаковый контент независимо от того, как модель была активирована: через промпт, градиентную настройку (fine-tuning) или управление во время инференса (inference-time steering).
Автор доказывает, что это предположение ошибочно. Идентичность репрезентативного контента — это не просто «vehicle» (носитель/вектор), а пара (vehicle, regime). То есть, личность модели существует только в контексте конкретного метода её активации.
Эмпирические доказательства на Qwen3 и Mistral
Для проверки гипотезы исследователь провел серию экспериментов на моделях Qwen3-4B-Instruct и Mistral-7B-Instruct-v0.2. Были выявлены четыре ключевых «клинов» (empirical wedges), разрушающих старую парадигму:
- Нерелятивистская коллинеарность: Векторы, извлеченные через промптинг, не совпадают по направлению с бассейнами настройки (fine-tune basins). Это означает, что «научить» модель быть персонажем и «попросить» её им стать — разные процессы с разными геометрическими последствиями.
- Сила фиктивных якорей: Фиктивные (вымышленные) персонажи вытесняют модель вдоль направлений реальных якорей (real-anchor directions) сильнее, чем сами реальные якоря. Это указывает на асимметрию в том, как модель кодирует вымысел и реальность.
- История обучения как аттрактор: При смешивании противоречивых валентностей (например, «добрый» и «злой» векторы) модель смещается не к среднему значению, а к аттрактору, определяемому её историей обучения. Личность не компонуется линейно.
- Асимметрия композиционной алгебры: Арифметика векторов во время инференса дает иные результаты, чем обучение chimera (гибридных) моделей через fine-tuning.
Сравнение режимов активации
Результаты экспериментов демонстрируют, что один и тот же вектор в разных режимах ведет себя как совершенно разные объекты. Ниже приведена сводка наблюдаемых эффектов:
| Режим активации | Наблюдаемое поведение вектора | Вывод исследования |
|---|---|---|
| Prompt-conditioning | Извлечение векторов не коллинеарно с fine-tune бассейнами | Вектор промпта ≠ вектор настройки |
| Fine-tuning | Фиктивные персонажи доминируют над реальными якорями | Вымысел имеет большую «массу» в латентном пространстве |
| Inference-time steering | Смещение к аттрактору истории обучения при конфликте | Личность не аддитивна, она исторически обусловлена |
| Compositional Algebra | Разница между арифметикой инференса и chimera training | Операции над векторами не коммутативны между режимами |
Почему это важно для индустрии
Результаты работы имеют прямое отношение к безопасности и контролю над LLM. Если «векторы личности» не являются стабильными единицами, то методы jailbreak-защиты или, наоборот, кастомизации персонажей, основанные на линейной алгебре латентного пространства, требуют пересмотра. Нельзя просто «вычесть» токсичность, найденную в промпте, если в режиме fine-tuning этот же вектор ведет себя иначе.
Предложенная Чэнгом модель «режимно-индексированной индивидации» (regime-indexed individuation) требует от исследователей и разработчиков учитывать контекст активации при работе с интерпретируемостью. Идентичность LLM — это не статичный объект, а динамический результат взаимодействия архитектуры, данных обучения и метода запроса.
Источник: arXiv cs.CL ↗
