Суть открытия: функциональное подтверждение гипотезы
Исследовательница Аюши Агарвал представила первое систематическое эмпирическое исследование переноса управления (steering transfer) между независимо обученными языковыми моделями. Работа подтверждает гипотезу платонических представлений (Platonic Representation Hypothesis): геометрическая конвергенция внутренних представлений в LLM позволяет использовать векторы одной модели для управления поведением другой, без необходимости тонкой настройки (fine-tuning).
Методология и масштаб
Для проверки гипотезы был проведен строгий эксперимент с использованием 5 открытых моделей (open-weight), охватывающих три масштаба параметров (от 0.8B до 8B) и две архитектурные линии. На каждой модели был обучен один Разреженный Автоэнкодер (Sparse Autoencoder, SAE) для выявления признаков в 15 семантических доменах. Тестирование проводилось на всех 20 направленных парах моделей.
Ключевые метрики и результаты
Исследование выявило четкий порог эффективности. При размере модели менее 1.7B перенос векторов управления практически не работает. Однако при достижении порога в 1.7B параметры наблюдается резкий скачок качества:
- 47–49% пар кросс-модельных признаков прошли валидацию (коэффициент Пирсона r ≥ 0.60).
- Косинусное сходство по методу Прокруста составило 0.895–0.956, что свидетельствует о высокой геометрической совместимости.
- Векторы управления, перенесенные из другой модели (B3-TI), достигли 71.0% побед в тестах на 15 концепциях, что сопоставимо с нативными векторами той же модели (68.0%).
| Параметр | Значение / Результат | Значимость |
|---|---|---|
| Порог масштаба | 1.7B параметров | Ниже этого уровня перенос неэффективен |
| Кросс-модельный Win Rate | 71.0% | Превосходит нативные векторы (68.0%) |
| Универсальный вектор | 67.3% (в 4 из 5 моделей) | Работает без пер-модельного дообучения |
| Геометрическое сходство | Procrustes cosine 0.895–0.956 | Высокая корреляция представлений |
Почему это важно для индустрии
Результаты ставят под сомнение необходимость создания уникальных инструментов интерпретируемости для каждой новой модели. Если архитектура и масштаб достаточны, исследователи могут использовать готовые векторы управления, валидированные на больших моделях (например, 7B), для контроля поведения меньших моделей. Однако авторы предупреждают: инструменты, проверенные на 7B, не гарантируют успеха на моделях ниже 1.7B без повторной валидации. Также отмечена зависимость от стабильности генерации: одна из моделей с нестабильным поведением показала деградацию переноса, что указывает на чувствительность метода к внутренним свойствам модели.
Источник: arXiv cs.CL ↗
