Исследования8 августа 2026 г., 03:17 МСК🤖 Auto

Перенос управления: как векторы одной модели управляют другой

Исследование подтверждает: геометрическое сходство LLM позволяет переносить векторы управления (steering) между разными архитектурами без дообучения, но только при достижении порога в 1.7B параметров.

Баннер новости 5348

Суть открытия: функциональное подтверждение гипотезы

Исследовательница Аюши Агарвал представила первое систематическое эмпирическое исследование переноса управления (steering transfer) между независимо обученными языковыми моделями. Работа подтверждает гипотезу платонических представлений (Platonic Representation Hypothesis): геометрическая конвергенция внутренних представлений в LLM позволяет использовать векторы одной модели для управления поведением другой, без необходимости тонкой настройки (fine-tuning).

Методология и масштаб

Для проверки гипотезы был проведен строгий эксперимент с использованием 5 открытых моделей (open-weight), охватывающих три масштаба параметров (от 0.8B до 8B) и две архитектурные линии. На каждой модели был обучен один Разреженный Автоэнкодер (Sparse Autoencoder, SAE) для выявления признаков в 15 семантических доменах. Тестирование проводилось на всех 20 направленных парах моделей.

Ключевые метрики и результаты

Исследование выявило четкий порог эффективности. При размере модели менее 1.7B перенос векторов управления практически не работает. Однако при достижении порога в 1.7B параметры наблюдается резкий скачок качества:

  • 47–49% пар кросс-модельных признаков прошли валидацию (коэффициент Пирсона r ≥ 0.60).
  • Косинусное сходство по методу Прокруста составило 0.895–0.956, что свидетельствует о высокой геометрической совместимости.
  • Векторы управления, перенесенные из другой модели (B3-TI), достигли 71.0% побед в тестах на 15 концепциях, что сопоставимо с нативными векторами той же модели (68.0%).
Параметр Значение / Результат Значимость
Порог масштаба 1.7B параметров Ниже этого уровня перенос неэффективен
Кросс-модельный Win Rate 71.0% Превосходит нативные векторы (68.0%)
Универсальный вектор 67.3% (в 4 из 5 моделей) Работает без пер-модельного дообучения
Геометрическое сходство Procrustes cosine 0.895–0.956 Высокая корреляция представлений

Почему это важно для индустрии

Результаты ставят под сомнение необходимость создания уникальных инструментов интерпретируемости для каждой новой модели. Если архитектура и масштаб достаточны, исследователи могут использовать готовые векторы управления, валидированные на больших моделях (например, 7B), для контроля поведения меньших моделей. Однако авторы предупреждают: инструменты, проверенные на 7B, не гарантируют успеха на моделях ниже 1.7B без повторной валидации. Также отмечена зависимость от стабильности генерации: одна из моделей с нестабильным поведением показала деградацию переноса, что указывает на чувствительность метода к внутренним свойствам модели.

Источник: arXiv cs.CL ↗