Проблема существующих методов
Традиционные подходы к steering (управлению поведением) больших языковых моделей часто опираются на обучаемые цели или выбирают признаки по одному критерию, что снижает прозрачность и надежность. Авторы работы "Statistically Grounded Sparse-Feature Interventions for Activation-Space Control in Large Language Models" (arXiv:2607.19364) предлагают альтернативу: конвейер, основанный на Sparse Autoencoders (SAE), который исключает этап обучения целевых векторов.
Методология: Фильтрация и Консенсус
Ключевая инновация — использование статистического консенсуса для выбора наиболее релевантных признаков. Процесс включает два этапа:
- Фильтр надежности: Применение фильтра из шести условий для отсечения шумовых активаций.
- Ранжирование по Borda: Использование не взвешенного консенсуса Борда (Borda consensus) для объединения трех статистик: F-тест, взаимная информация KSG и эффект Когена d.
Итоговый вектор управления формируется как комбинация строк декодера SAE, взвешенная по эффекту Когена d. Этот подход мотивирован методом Фишера-ЛДА (Fisher-LDA) и предполагает декорреляцию признаков SAE.
Результаты на моделях Gemma
Метод протестирован на трех моделях семейства Gemma, охватывая четыре поведенческих домена и 356 конфигураций силы воздействия (layer-strength). Исследование выявило, что полезное управление сильно локализовано: зависит от модели, домена, слоя и силы воздействия. Главное достижение — прирост качества генерации, а не просто сдвиг атрибутов.
| Модель | Домен | Метрика | Результат (Delta) |
|---|---|---|---|
| Gemma 2 9B | Логическая корректность | Primary Score | +1.16 |
| Всего протестировано конфигураций | 356 | ||
| Семейство моделей | Gemma (3 модели) | ||
Вывод для индустрии
Авторы подчеркивают критический разрыв между «сырым» перемещением атрибутов в активационном пространстве и генерацией текста, сохраняющего качество. Работа аргументирует необходимость того, чтобы оценки activation-steering всегда включали метрики качества (quality-conditioned success), а не только фиксацию сдвига поведения. Код и данные доступны в открытом доступе.
Источник: arXiv cs.AI ↗
