Исследования14 сентября 2026 г., 15:47 МСК🤖 Auto

CVRR: Как заставить VLM мыслить причинно-следственно

Лаборатория DMIS (KAIST) представила CVRR — метод, который делает визуальную информацию строго необходимой для ответа, устраняя «галлюцинации» через рекуррентное причинное рассуждение.

Баннер новости 7453

Проблема: Визуальные данные игнорируются декодером

Современные мультимодальные языковые модели (VLM) часто сохраняют важную визуальную информацию в латентных состояниях, но не используют её при генерации ответа. Декодер может опираться на текстовые паттерны, игнорируя изображение. CVRR (Causal Visual Recurrent Reasoning) решает эту проблему, делая визуальные данные причинно необходимыми для вывода ответа, не нарушая при этом базовые способности модели.

Архитектура: Три ключевых компонента

Метод базируется на трех принципах, внедряемых в архитектуру Qwen2.5-VL-7B:

  • Causal Visual-Read Boundary: Использование патчинга активаций на уровне слоев (layer-wise activation patching) для точного определения того, где визуальная информация интегрируется в представление вопроса.

  • Persistent Visual Recurrence: Слой декодера, следующий сразу после границы, становится общим рекуррентным переходом. Состояние вопроса обновляется многократно, пока визуальные строки остаются доступными внутри рекуррентных вычислений.

  • Strict Causal Decoder Interface: К верхнему декодеру ответа попадает только финальное рекуррентное состояние вопроса. Оригинальные мультимодальные скрытые состояния и визуальные строки исключены из процесса декодирования ответа.

Технические детали и конфигурация

Для модели Qwen2.5-VL-7B используется следующая конфигурация по умолчанию:

ПараметрЗначение
Граница чтения (Boundary Layer)20
Рекуррентный переход (Shared Layer)21
Количество рекуррентных состояний4
LoRA ранг (Attention & MLP)32
Обучение бэкбонаЗаморожен (Frozen)
Функция потерьCross-Entropy по токенам ответа

Инференс: Разделение потоков

Ключевая особенность CVRR при инференсе — разделение кодировки на два потока для одного промпта:

  • Текстовый поток (Text-only): Поставляет контекст префикса ответа для нижних слоев.
  • Мультимодальный поток (Multimodal): Поставляет рекуррентное визуальное состояние.

Это позволяет модели использовать визуальные признаки как «память» задачи, которую затем обрабатывает текстовый декодер, исключая прямое смешивание визуальных токенов с токенами ответа на финальных этапах.

Оценка и доступность

Модель оценивалась на наборах данных V*, MMVP, BLINK, MME-RealWorld-Lite. Поддерживаются два протокола: жадная генерация (greedy) и оценка логитов первого токена (choice_logits) для каузального анализа. Код и веса (dmis-lab/Qwen2.5-VL-7B-CVRR) доступны на Hugging Face с поддержкой trust_remote_code=True.

Источник: Github ↗