Исследования28 июля 2026 г., 16:17 МСК🤖 Auto

Reference Feature Atlases: новый стандарт аудита LLM

Исследователи представили метод Reference Feature Atlases, позволяющий анализировать внутренние механизмы языковых моделей без переобучения с нуля, что ускоряет аудит и повышает точность обнаружения скрытых паттернов.

Баннер новости 4547

Проблема: дороговизна механического аудита

Традиционный аудит новых языковых моделей (LLM) требует полного переобучения и переинтерпретации внутренних признаков (features) с нуля для каждой новой модели. Этот процесс ресурсоемок и не масштабируется. Авторы работы Rui Wu и Tong Che предлагают решение — Reference Feature Atlas (Атлас справочных признаков): разреженную библиотеку признаков, обученную один раз на референсной панели моделей, которая затем используется для анализа новых целевых моделей путем дообучения только линейного декодера.

Методология: два канала анализа

Предложенный подход обеспечивает два взаимодополняющих взгляда на работу модели:

  • Канал атласа (Atlas channel): считывает целевую модель через уже интерпретированные признаки референсной панели, создавая стабильную систему координат для сравнения разных моделей.
  • Остаточный канал (Residual channel): обучается исключительно на том, что атлас не смог реконструировать. Это делает «неизвестное» (вне референсной панели) явным сигналом для аудита, позволяя выявлять уникальные для конкретной модели механизмы.

Экспериментальные результаты

Исследователи обучили атласы методом leave-one-out на пяти инструкционно-обученных моделях размером 7–9B параметров. Затем они провели аудит моделей Mistral и Qwen, внедрив в них контролируемые скрытые цели (hidden objectives) через LoRA. Результаты сравнения с базовыми методами (SAE и crosscoder) приведены ниже:

Метод / Модель Обнаружение planted objective (LoRA) Стабильность (контроль) Результат аудита
Reference Feature Atlas (Residual) Идеально контролируемо во время выполнения Контрольные группы не затронуты Восстановлена цель как топ-1 латент
SAE / Crosscoder (Mistral) Не удалось Провал в head-to-head бенчмарке
Reference Feature Atlas (Qwen-2.5) Обнаружено Выявлен кластер политического фрейминга; управление им меняет метрики, не затрагивая out-of-domain контроль

Значение для индустрии

Метод демонстрирует, что «вне референсной панели» не является черным ящиком, а может быть явно измерено. Особенно показателен случай с Qwen-2.5, где метод выявил специфический кластер политического фрейминга, управление которым позволяло точно настраивать выходные метрики модели без побочных эффектов на другие аспекты. Это открывает путь к более прозрачному и эффективному контролю над поведением больших языковых моделей.

Источник: arXiv cs.AI ↗