Проблема пространственных галлюцинаций
Мультимодальные большие языковые модели (MLLM) демонстрируют впечатляющие результаты в Visual Question Answering (VQA), но часто страдают от «галлюцинаций» — уверенных, но визуально необоснованных ответов. Основная причина — недостаточное понимание мелких деталей и пространственных отношений. Модель видит картинку как единое целое, упуская контекст отдельных объектов.
Архитектура ReVA: два моста к LLM
Авторы предлагают решение ReVA (Region-Aware Visual Assistant), которое разделяет визуальное представление на два уровня. Модель использует замороженный CLIP ViT-L/14 для извлечения признаков и Qwen2.5-7B-Instruct в качестве языкового ядра. Ключевое нововведение — двойной мост (dual bridge), который:
- Image Bridge: мапит финальные признаки трансформера в токены изображения (общий контекст сцены).
- Region Bridge: мапит усеченные признаки из промежуточных слоев ViT в K токенов для каждого ограничивающего прямоугольника (bounding box). Это позволяет LLM видеть текстуры на ранних этапах и объекты — на поздних.
Автоматическое выделение регионов
Для создания bounding boxes используется стек детекторов без обучения (zero-shot): RAM++ (Recognize Anything Model), spaCy и Grounding DINO. Система генерирует как вопрос-независимые, так и вопрос-зависимые рамки, которые затем конкатенируются с токенами изображения перед подачей в LLM.
Результаты бенчмарков
Оценка проводилась на четырех ключевых датасетах. Главная метрика — снижение галлюцинаций и повышение фактологической точности. ReVA превосходит базовую модель, использующую только токены изображения (без региональных).
| Датасет | Метрика | Результат ReVA | Базовая модель (Image-only) |
|---|---|---|---|
| POPE | Mean F1 | 82.85% | 81.14% |
| VQAv2 | — | — | — |
| MMBench | — | — | — |
| SEED-Bench | — | — | — |
Результаты подтверждают: явное выделение региональных представлений значительно снижает вероятность галлюцинаций объектов и атрибутов, делая ответы MLLM более надежными.
Бенчмарки
| Бенчмарк | ReVA | image-token baseline |
|---|---|---|
| POPE | 82.85% | 81.14% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: arXiv cs.CL ↗
