Исследования28 июля 2026 г., 07:16 МСК🤖 Auto

C-VCE: Объяснимые ИИ через диффузию и концепции

Исследователи представили C-VCE — фреймворк, использующий диффузионные модели для создания визуальных контрфактуальных объяснений, интегрируя классификатор прямо в генеративную сеть.

Баннер новости 4512

Проблема существующих методов

Визуальные контрфактуальные объяснения (Visual Counterfactual Explanations) отвечают на вопрос: «Какое минимальное изменение изображения изменит прогноз модели?». Это критически важно для медицины и других safety-critical областей. Однако существующие диффузионные методы часто полагаются на внешние классификаторы, которые должны работать с зашумленными изображениями. Это делает их хрупкими и сложными для надежного развертывания.

Решение: C-VCE

Авторы (Yassine Oueslati, Daniil Kirilenko, Martin Gjoreski, Marc Langheinrich) представили C-VCE — новый диффузионный фреймворк, который встраивает классификатор непосредственно в генеративную модель через concept bottleneck layer (слой концептуального бутылочного горлышка). Это позволяет направлять генерацию на основе человеко-интерпретируемых концепций, а не полагаться на отдельный классификатор, работающий на уровне пикселей.

Ключевые технические особенности

  • Управление концепциями: Пользователи могут включать/выключать семантические концепции во время сэмплирования.
  • Локальные изменения: Модель минимально корректирует только релевантные области изображения, сохраняя остальное нетронутым и соблюдая корреляции признаков.
  • Вероятностный регуляризатор: Балансирует цель «изменить прогноз» против «остаться близким к оригиналу».
  • Градиентная маска: Ограничивает модификации наиболее релевантными регионами.

Результаты на бенчмарках

На датасете CelebA C-VCE демонстрирует сопоставимые или лучшие показатели переключения прогнозов (flip rates), при этом создавая контрфактуалы, визуально более близкие к исходному изображению и менее искаженные по сравнению с базовыми методами, зависящими от внешних классификаторов.

Характеристика Существующие диффузионные методы C-VCE (предлагаемый метод)
Архитектура классификации Внешний классификатор (хрупкий к шуму) Встроенный слой концепций (concept bottleneck)
Управляемость Пиксельные правки Семантические концепции (вкл/выкл)
Визуальное качество Часто искаженные правки Близко к оригиналу, сохранение корреляций
Интерпретируемость Низкая (черный ящик + правки) Высокая (через концепции)

Значение для индустрии

Работа, принятая к публикации на XAI 2026 (4-я Всемирная конференция по объяснимому ИИ), предлагает путь к созданию более безопасных и понятных генеративных моделей. Интеграция контроля над внутренними концепциями позволяет пользователям получать конкретные визуальные сценарии «что, если», не требуя доверия к дополнительным, шумоустойчивым классификаторам.

Источник: arXiv cs.AI ↗