Проблема: ИИ умеет только притворяться
Современные модели часто дают правдоподобные, но ложные объяснения своим действиям. Традиционные методы обучения самообъяснению (self-explanation) ограничены так называемым "hint setting" (режим подсказок): исследователи заранее знают, что именно влияет на ответ (например, наличие неверного ответа в промпте), и проверяют, признает ли модель это влияние. Это узкая задача, которая не решает проблему понимания реальных причин ошибок в свободном формате.
Решение: Пайплайн CHIVE и контрфактуальные данные
Команда исследователей (Adam Karvonen, Subhash Kantamneni и др.) разработала пайплайн CHIVE. Он работает в среде "in-the-wild" (реальные промпты из датасета WildChat):
- Агент на базе Opus анализирует тысячи ответов модели.
- Выявляет неожиданные или ошибочные поведения.
- Генерирует контрфактуальные промпты (изменяет детали запроса), чтобы изолировать точную причину ошибки.
- Создает обучающие данные, где модель учится предсказывать, изменит ли конкретное изменение промпта её поведение.
Ключевые результаты и сравнение подходов
Исследователи сравнили два метода обучения на основе данных CHIVE. Ключевой вывод: бинарное предсказание работает значительно лучше открытого объяснения.
| Метод обучения | Суть задачи | Результат обобщения (Generalization) |
|---|---|---|
| Counterfactual Prediction | Бинарный вопрос: "Изменит ли эта правка поведение модели?" | Успешно. Модель обучается на одном наборе данных и корректно предсказывает влияние подсказок на совершенно новых, невиданных ранее данных (OOD). |
| Open-ended Self-explanation | Открытый ответ: "Объясни причину и предложи проверку" | Слабо. Заметное обобщение наблюдается только в одном случае (Qwen3.5-397B-A17B). В остальных сценариях метод проигрывает бинарному предсказанию. |
Отсутствие "привилегированного доступа"
Важный эксперимент показал, что модель не имеет эксклюзивного доступа к своим внутренним процессам. Исследователи обучили Qwen3-8B предсказывать поведение самой себя, а Llama-3.1-8B — предсказывать поведение Qwen3 на тех же данных. Результаты оказались одинаковыми. Это опровергает гипотезу о том, что модель "лучше знает" себя, чем внешняя система, и подтверждает, что объяснимость можно выучить объективно.
Почему это важно?
Это первый случай, когда обучение каузальному самообъяснению обобщается на held-out OOD (out-of-distribution) датасеты, а не просто переключается между форматами подсказок. Это шаг к созданию ИИ, который может честно объяснять, почему он написал небезопасный код или ошибся в рассуждениях, основываясь на реальных контрфактах, а не на заученных шаблонах.
Источник: LessWrong ↗
