Проблема разрозненных сигналов
Современные мультимодальные модели (VLM) часто сталкиваются с ситуацией, когда извлеченный текст и визуальный контент противоречат друг другу или оба содержат ошибки. Традиционные методы пост-обучения оценивают каждый случай изолированно, что не гарантирует согласованности поведения при изменении контрфактических условий. Модель может «угадать» ответ в одном случае, но ошибиться в похожем, если входные данные слегка изменятся.
Решение: Групповая оптимизация с ограничением риска
Команда авторов (De Jiang, Zhengyang Zhang, Kehong Yuan, Shaohua Ma) предложила фреймворк CARGO-VL (Counterfactual Arbitration with Risk-Constrained Group Optimization). Ключевая инновация заключается в том, что модель обучается не на отдельных примерах, а на сгруппированных вариантах, охватывающих четыре состояния доказательств:
- A (Aligned): Текст и изображение согласованы и верны.
- V (Image-correct): Только изображение содержит верный ответ.
- T (Text-correct): Только текст содержит верный ответ.
- N (Both-wrong): И текст, и изображение ошибочны.
Механизм работы: Переходные награды
Целевая функция CARGO-VL связывает правильность каждого состояния с «наградами за переход» (transition rewards). Модель поощряется за:
- Инвариантность ответа: Сохранение правильного вывода при незначительных изменениях контрфактических условий.
- Эквивариантность источника: Способность корректно переключаться между опорами на текст или изображение.
- Переключение на отказ: Умение сказать «я не знаю», когда оба источника ненадежны.
Для балансировки между опасными ответами и чрезмерным отказом от ответа используется primal-dual controller (двойственно-первичный контроллер), который динамически регулирует уровень риска.
Новый датасет XMC
Авторы также представили ресурс для обучения XMC (eXtended Modal Conflict) — набор данных, специально созданный для тренировки моделей на конфликтах модальностей. Это позволяет модели заранее «научиться» распознавать ситуации, где визуальные и текстовые подсказки конфликтуют.
Результаты и значимость
Оценка проводилась на бенчмарках CMC-Bench и Modality-Bias. Результаты показали, что CARGO-VL превосходит точечные (pointwise) базовые модели в трех ключевых аспектах:
- Обработка конфликтов (conflict handling).
- Избегание ответов без поддержки (unsupported-answer avoidance).
- Баланс модальностей (modality balance).
| Метрика / Аспект | Преимущество CARGO-VL |
|---|---|
| Контрфактическая согласованность | Выше за счет групповых переходных сигналов |
| Отказ от ответа при ошибках | Более точная настройка через primal-dual контроллер |
| Устойчивость к смещению модальностей | Сбалансированное использование V и T источников |
Исследование демонстрирует, что контрфактическая согласованность может быть не просто теоретической концепцией, а практической целью для создания надежных мультимодальных систем, способных к арбитражу доказательств.
Источник: arXiv cs.AI ↗
