Проблема: Визуальные данные игнорируются декодером
Современные мультимодальные языковые модели (VLM) часто сохраняют важную визуальную информацию в латентных состояниях, но не используют её при генерации ответа. Декодер может опираться на текстовые паттерны, игнорируя изображение. CVRR (Causal Visual Recurrent Reasoning) решает эту проблему, делая визуальные данные причинно необходимыми для вывода ответа, не нарушая при этом базовые способности модели.
Архитектура: Три ключевых компонента
Метод базируется на трех принципах, внедряемых в архитектуру Qwen2.5-VL-7B:
- Causal Visual-Read Boundary: Использование патчинга активаций на уровне слоев (layer-wise activation patching) для точного определения того, где визуальная информация интегрируется в представление вопроса.
- Persistent Visual Recurrence: Слой декодера, следующий сразу после границы, становится общим рекуррентным переходом. Состояние вопроса обновляется многократно, пока визуальные строки остаются доступными внутри рекуррентных вычислений.
- Strict Causal Decoder Interface: К верхнему декодеру ответа попадает только финальное рекуррентное состояние вопроса. Оригинальные мультимодальные скрытые состояния и визуальные строки исключены из процесса декодирования ответа.
Технические детали и конфигурация
Для модели Qwen2.5-VL-7B используется следующая конфигурация по умолчанию:
| Параметр | Значение |
|---|---|
| Граница чтения (Boundary Layer) | 20 |
| Рекуррентный переход (Shared Layer) | 21 |
| Количество рекуррентных состояний | 4 |
| LoRA ранг (Attention & MLP) | 32 |
| Обучение бэкбона | Заморожен (Frozen) |
| Функция потерь | Cross-Entropy по токенам ответа |
Инференс: Разделение потоков
Ключевая особенность CVRR при инференсе — разделение кодировки на два потока для одного промпта:
- Текстовый поток (Text-only): Поставляет контекст префикса ответа для нижних слоев.
- Мультимодальный поток (Multimodal): Поставляет рекуррентное визуальное состояние.
Это позволяет модели использовать визуальные признаки как «память» задачи, которую затем обрабатывает текстовый декодер, исключая прямое смешивание визуальных токенов с токенами ответа на финальных этапах.
Оценка и доступность
Модель оценивалась на наборах данных V*, MMVP, BLINK, MME-RealWorld-Lite. Поддерживаются два протокола: жадная генерация (greedy) и оценка логитов первого токена (choice_logits) для каузального анализа. Код и веса (dmis-lab/Qwen2.5-VL-7B-CVRR) доступны на Hugging Face с поддержкой trust_remote_code=True.
Источник: Github ↗
