Исследования6 августа 2026 г., 11:16 МСК🤖 Auto

CARGO-VL: Новый подход к доверию мультимодальных AI

Исследователи представили CARGO-VL — метод обучения, который заставляет модели-кандидаты оценивать противоречия между текстом и изображением, снижая галлюцинации через групповую оптимизацию.

Баннер новости 5197

Проблема разрозненных сигналов

Современные мультимодальные модели (VLM) часто сталкиваются с ситуацией, когда извлеченный текст и визуальный контент противоречат друг другу или оба содержат ошибки. Традиционные методы пост-обучения оценивают каждый случай изолированно, что не гарантирует согласованности поведения при изменении контрфактических условий. Модель может «угадать» ответ в одном случае, но ошибиться в похожем, если входные данные слегка изменятся.

Решение: Групповая оптимизация с ограничением риска

Команда авторов (De Jiang, Zhengyang Zhang, Kehong Yuan, Shaohua Ma) предложила фреймворк CARGO-VL (Counterfactual Arbitration with Risk-Constrained Group Optimization). Ключевая инновация заключается в том, что модель обучается не на отдельных примерах, а на сгруппированных вариантах, охватывающих четыре состояния доказательств:

  • A (Aligned): Текст и изображение согласованы и верны.
  • V (Image-correct): Только изображение содержит верный ответ.
  • T (Text-correct): Только текст содержит верный ответ.
  • N (Both-wrong): И текст, и изображение ошибочны.

Механизм работы: Переходные награды

Целевая функция CARGO-VL связывает правильность каждого состояния с «наградами за переход» (transition rewards). Модель поощряется за:

  1. Инвариантность ответа: Сохранение правильного вывода при незначительных изменениях контрфактических условий.
  2. Эквивариантность источника: Способность корректно переключаться между опорами на текст или изображение.
  3. Переключение на отказ: Умение сказать «я не знаю», когда оба источника ненадежны.

Для балансировки между опасными ответами и чрезмерным отказом от ответа используется primal-dual controller (двойственно-первичный контроллер), который динамически регулирует уровень риска.

Новый датасет XMC

Авторы также представили ресурс для обучения XMC (eXtended Modal Conflict) — набор данных, специально созданный для тренировки моделей на конфликтах модальностей. Это позволяет модели заранее «научиться» распознавать ситуации, где визуальные и текстовые подсказки конфликтуют.

Результаты и значимость

Оценка проводилась на бенчмарках CMC-Bench и Modality-Bias. Результаты показали, что CARGO-VL превосходит точечные (pointwise) базовые модели в трех ключевых аспектах:

  • Обработка конфликтов (conflict handling).
  • Избегание ответов без поддержки (unsupported-answer avoidance).
  • Баланс модальностей (modality balance).
Метрика / Аспект Преимущество CARGO-VL
Контрфактическая согласованность Выше за счет групповых переходных сигналов
Отказ от ответа при ошибках Более точная настройка через primal-dual контроллер
Устойчивость к смещению модальностей Сбалансированное использование V и T источников

Исследование демонстрирует, что контрфактическая согласованность может быть не просто теоретической концепцией, а практической целью для создания надежных мультимодальных систем, способных к арбитражу доказательств.

Источник: arXiv cs.AI ↗