Проблема «черного ящика» и новый подход CHIVE
Проблема интерпретируемости больших языковых моделей (LLM) заключается в отсутствии объективного критерия качества объяснения. Авторы работы, опубликованной на LessWrong, предлагают оценивать объяснения через призму контрфактуальной симулируемости: хорошее объяснение должно позволять предсказать, как изменится поведение модели при изменении входных данных.
Для этого они создали CHIVE (Counterfactual Hypothesis Investigation Via Edits) — агентный пайплайн, который автоматически:
- Сэмплирует ответы модели на набор промптов (30 ответов на каждый).
- Отбирает неожиданные поведения с помощью агента-исследователя.
- Проводит 5–15 контрфактуальных экспериментов для каждого случая, редактируя промпты и измеряя изменение частоты поведения.
- Верифицирует гипотезы независимым судьей.
Эксперимент: инструменты интерпретируемости против базовой линии
Ключевой вопрос исследования: дают ли современные инструменты интерпретируемости реальное преимущество при анализе поведения модели «в дикой природе»? Для проверки использовался предиктор на базе Claude Opus 4.8 (в основных экспериментах), которому предлагалось оценить истинность контрфактуального утверждения.
Сравнивались следующие конфигурации:
- Baseline (Транскрипт): Агент видит только историю диалога/промпт.
- Activation Oracles (AO): Модели, обученные отвечать на вопросы об активациях.
- Natural-language Autoencoders (NLA): Модели, описывающие активации естественным языком.
- Sparse Autoencoders (SAE): Словари, разлагающие активации на разреженные признаки.
Результаты: нулевой прирост (No Uplift)
Результаты оказались неожиданными для сообщества AI Safety. Ни один из инструментов интерпретируемости не превзошел простую базовую линию чтения транскрипта. Более того, в некоторых случаях инструменты вводили агентов в заблуждение.
| Инструмент / Конфигурация | Роль в эксперименте | Результат сравнения с Baseline |
|---|---|---|
| Транскрипт (Baseline) | Исходные данные (промпт + ответы) | Референс (100%) |
| Activation Oracle (AO) | Чтение активаций через NL-вопросы | Не превосходит Baseline |
| Natural-language Autoencoder (NLA) | Описание активаций текстом | Не превосходит Baseline |
| Sparse Autoencoder (SAE) | Разложение на разреженные признаки | Не превосходит Baseline |
Почему инструменты не сработали?
Авторы анализируют причины провала. Проблема не в том, что агенты игнорируют инструменты. Например, NLA мог корректно описать, что модель генерирует случайное число, что помогало в отдельных случаях. Однако:
- Корреляция ≠ Причинность: Инструменты описывают состояние активаций и поведение, но почти никогда не указывают на причинно-следственную связь между ними. Агенту приходится выводить причинность из корреляционных сигналов.
- Шум и избыточность: Выводы инструментов часто дублируют информацию, уже доступную в транскрипте, но добавляют шум, который сбивает с толку предиктор.
Выводы для индустрии
Результаты CHIVE ставят под сомнение эффективность текущих методов интерпретируемости для задач аудита и безопасности в реальных сценариях. Если инструмент не может улучшить предсказание контрфактуальных изменений поведения по сравнению с простым анализом логов, его ценность для системных карточек (system cards) и аудита безопасности требует пересмотра. При этом данные, сгенерированные CHIVE, показали высокую полезность для дообучения моделей предсказывать собственные изменения поведения.
Источник: LessWrong ↗
