Релиз модели2 сентября 2026 г., 06:17 МСК🤖 Auto

ReVA: Как region-aware архитектура убивает галлюцинации MLLM

Исследователи представили ReVA — модель VQA, которая использует двухуровневое выравнивание изображений (общее и региональное) для точного ответа на вопросы. Реализация на базе Qwen2.5-7B и CLIP показала рост точности на 1.7% по сравнению с базовыми м

Баннер новости 6555

Проблема пространственных галлюцинаций

Мультимодальные большие языковые модели (MLLM) демонстрируют впечатляющие результаты в Visual Question Answering (VQA), но часто страдают от «галлюцинаций» — уверенных, но визуально необоснованных ответов. Основная причина — недостаточное понимание мелких деталей и пространственных отношений. Модель видит картинку как единое целое, упуская контекст отдельных объектов.

Архитектура ReVA: два моста к LLM

Авторы предлагают решение ReVA (Region-Aware Visual Assistant), которое разделяет визуальное представление на два уровня. Модель использует замороженный CLIP ViT-L/14 для извлечения признаков и Qwen2.5-7B-Instruct в качестве языкового ядра. Ключевое нововведение — двойной мост (dual bridge), который:

  • Image Bridge: мапит финальные признаки трансформера в токены изображения (общий контекст сцены).
  • Region Bridge: мапит усеченные признаки из промежуточных слоев ViT в K токенов для каждого ограничивающего прямоугольника (bounding box). Это позволяет LLM видеть текстуры на ранних этапах и объекты — на поздних.

Автоматическое выделение регионов

Для создания bounding boxes используется стек детекторов без обучения (zero-shot): RAM++ (Recognize Anything Model), spaCy и Grounding DINO. Система генерирует как вопрос-независимые, так и вопрос-зависимые рамки, которые затем конкатенируются с токенами изображения перед подачей в LLM.

Результаты бенчмарков

Оценка проводилась на четырех ключевых датасетах. Главная метрика — снижение галлюцинаций и повышение фактологической точности. ReVA превосходит базовую модель, использующую только токены изображения (без региональных).

Датасет Метрика Результат ReVA Базовая модель (Image-only)
POPE Mean F1 82.85% 81.14%
VQAv2
MMBench
SEED-Bench

Результаты подтверждают: явное выделение региональных представлений значительно снижает вероятность галлюцинаций объектов и атрибутов, делая ответы MLLM более надежными.

Бенчмарки

БенчмаркReVAimage-token baseline
POPE82.85%81.14%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: arXiv cs.CL ↗