Исследования23 июля 2026 г., 12:18 МСК🤖 Auto

Статистический контроль активаций: новый метод для LLM

Исследователи представили метод управления поведением LLM через активационное пространство (activation steering) без дообучения, основанный на статистической фильтрации и консенсусе.

Баннер новости 4197

Проблема существующих методов

Традиционные подходы к steering (управлению поведением) больших языковых моделей часто опираются на обучаемые цели или выбирают признаки по одному критерию, что снижает прозрачность и надежность. Авторы работы "Statistically Grounded Sparse-Feature Interventions for Activation-Space Control in Large Language Models" (arXiv:2607.19364) предлагают альтернативу: конвейер, основанный на Sparse Autoencoders (SAE), который исключает этап обучения целевых векторов.

Методология: Фильтрация и Консенсус

Ключевая инновация — использование статистического консенсуса для выбора наиболее релевантных признаков. Процесс включает два этапа:

  • Фильтр надежности: Применение фильтра из шести условий для отсечения шумовых активаций.
  • Ранжирование по Borda: Использование не взвешенного консенсуса Борда (Borda consensus) для объединения трех статистик: F-тест, взаимная информация KSG и эффект Когена d.

Итоговый вектор управления формируется как комбинация строк декодера SAE, взвешенная по эффекту Когена d. Этот подход мотивирован методом Фишера-ЛДА (Fisher-LDA) и предполагает декорреляцию признаков SAE.

Результаты на моделях Gemma

Метод протестирован на трех моделях семейства Gemma, охватывая четыре поведенческих домена и 356 конфигураций силы воздействия (layer-strength). Исследование выявило, что полезное управление сильно локализовано: зависит от модели, домена, слоя и силы воздействия. Главное достижение — прирост качества генерации, а не просто сдвиг атрибутов.

Модель Домен Метрика Результат (Delta)
Gemma 2 9B Логическая корректность Primary Score +1.16
Всего протестировано конфигураций 356
Семейство моделей Gemma (3 модели)

Вывод для индустрии

Авторы подчеркивают критический разрыв между «сырым» перемещением атрибутов в активационном пространстве и генерацией текста, сохраняющего качество. Работа аргументирует необходимость того, чтобы оценки activation-steering всегда включали метрики качества (quality-conditioned success), а не только фиксацию сдвига поведения. Код и данные доступны в открытом доступе.

Источник: arXiv cs.AI ↗