Исследования4 сентября 2026 г., 21:19 МСК🤖 Auto

CHIVE: Как обучить ИИ понимать свои ошибки в реальных условиях

Исследователи представили пайплайн CHIVE, который генерирует данные для обучения моделей каузальному самообъяснению. Главный прорыв — обобщение на новые задачи без узких 'подсказок'.

Баннер новости 6798

Проблема: ИИ умеет только притворяться

Современные модели часто дают правдоподобные, но ложные объяснения своим действиям. Традиционные методы обучения самообъяснению (self-explanation) ограничены так называемым "hint setting" (режим подсказок): исследователи заранее знают, что именно влияет на ответ (например, наличие неверного ответа в промпте), и проверяют, признает ли модель это влияние. Это узкая задача, которая не решает проблему понимания реальных причин ошибок в свободном формате.

Решение: Пайплайн CHIVE и контрфактуальные данные

Команда исследователей (Adam Karvonen, Subhash Kantamneni и др.) разработала пайплайн CHIVE. Он работает в среде "in-the-wild" (реальные промпты из датасета WildChat):

  • Агент на базе Opus анализирует тысячи ответов модели.
  • Выявляет неожиданные или ошибочные поведения.
  • Генерирует контрфактуальные промпты (изменяет детали запроса), чтобы изолировать точную причину ошибки.
  • Создает обучающие данные, где модель учится предсказывать, изменит ли конкретное изменение промпта её поведение.

Ключевые результаты и сравнение подходов

Исследователи сравнили два метода обучения на основе данных CHIVE. Ключевой вывод: бинарное предсказание работает значительно лучше открытого объяснения.

Метод обучения Суть задачи Результат обобщения (Generalization)
Counterfactual Prediction Бинарный вопрос: "Изменит ли эта правка поведение модели?" Успешно. Модель обучается на одном наборе данных и корректно предсказывает влияние подсказок на совершенно новых, невиданных ранее данных (OOD).
Open-ended Self-explanation Открытый ответ: "Объясни причину и предложи проверку" Слабо. Заметное обобщение наблюдается только в одном случае (Qwen3.5-397B-A17B). В остальных сценариях метод проигрывает бинарному предсказанию.

Отсутствие "привилегированного доступа"

Важный эксперимент показал, что модель не имеет эксклюзивного доступа к своим внутренним процессам. Исследователи обучили Qwen3-8B предсказывать поведение самой себя, а Llama-3.1-8B — предсказывать поведение Qwen3 на тех же данных. Результаты оказались одинаковыми. Это опровергает гипотезу о том, что модель "лучше знает" себя, чем внешняя система, и подтверждает, что объяснимость можно выучить объективно.

Почему это важно?

Это первый случай, когда обучение каузальному самообъяснению обобщается на held-out OOD (out-of-distribution) датасеты, а не просто переключается между форматами подсказок. Это шаг к созданию ИИ, который может честно объяснять, почему он написал небезопасный код или ошибся в рассуждениях, основываясь на реальных контрфактах, а не на заученных шаблонах.

Источник: LessWrong ↗