Проблема существующих методов
Визуальные контрфактуальные объяснения (Visual Counterfactual Explanations) отвечают на вопрос: «Какое минимальное изменение изображения изменит прогноз модели?». Это критически важно для медицины и других safety-critical областей. Однако существующие диффузионные методы часто полагаются на внешние классификаторы, которые должны работать с зашумленными изображениями. Это делает их хрупкими и сложными для надежного развертывания.
Решение: C-VCE
Авторы (Yassine Oueslati, Daniil Kirilenko, Martin Gjoreski, Marc Langheinrich) представили C-VCE — новый диффузионный фреймворк, который встраивает классификатор непосредственно в генеративную модель через concept bottleneck layer (слой концептуального бутылочного горлышка). Это позволяет направлять генерацию на основе человеко-интерпретируемых концепций, а не полагаться на отдельный классификатор, работающий на уровне пикселей.
Ключевые технические особенности
- Управление концепциями: Пользователи могут включать/выключать семантические концепции во время сэмплирования.
- Локальные изменения: Модель минимально корректирует только релевантные области изображения, сохраняя остальное нетронутым и соблюдая корреляции признаков.
- Вероятностный регуляризатор: Балансирует цель «изменить прогноз» против «остаться близким к оригиналу».
- Градиентная маска: Ограничивает модификации наиболее релевантными регионами.
Результаты на бенчмарках
На датасете CelebA C-VCE демонстрирует сопоставимые или лучшие показатели переключения прогнозов (flip rates), при этом создавая контрфактуалы, визуально более близкие к исходному изображению и менее искаженные по сравнению с базовыми методами, зависящими от внешних классификаторов.
| Характеристика | Существующие диффузионные методы | C-VCE (предлагаемый метод) |
|---|---|---|
| Архитектура классификации | Внешний классификатор (хрупкий к шуму) | Встроенный слой концепций (concept bottleneck) |
| Управляемость | Пиксельные правки | Семантические концепции (вкл/выкл) |
| Визуальное качество | Часто искаженные правки | Близко к оригиналу, сохранение корреляций |
| Интерпретируемость | Низкая (черный ящик + правки) | Высокая (через концепции) |
Значение для индустрии
Работа, принятая к публикации на XAI 2026 (4-я Всемирная конференция по объяснимому ИИ), предлагает путь к созданию более безопасных и понятных генеративных моделей. Интеграция контроля над внутренними концепциями позволяет пользователям получать конкретные визуальные сценарии «что, если», не требуя доверия к дополнительным, шумоустойчивым классификаторам.
Источник: arXiv cs.AI ↗
