Проблема доверия в мультимодальных системах
По мере внедрения систем вопрос-ответ (QA), опирающихся на внешние знания, критически важным становится не только качество ответа, но и возможность точно указать, какая часть текста или изображения стала источником информации. В то время как для текстовых данных (унимодальных) методы атрибуции уже хорошо изучены, мультимодальные сценарии (текст + изображения/графики в длинных документах) остаются «темной материей» AI-исследований. Отсутствие надежных инструментов для верификации источников снижает доверие пользователей и повышает риски галлюцинаций.
Решение: MultAttnAttrib
Команда исследователей во главе с Dang Quang Thien Tran представила MultAttnAttrib — метод, который не требует дообучения модели (training-free). Алгоритм использует данные из этапа префайла (prefill pass) трансформера, анализируя активность определенных attention-голов и применяя калиброванные пороги для локализации источников внутри длинных документов. Это позволяет системе «понимать», откуда она взяла информацию, без дополнительных вычислительных затрат на генерацию.
Новый бенчмарк: MultAttrEval
Для оценки метода авторы создали MultAttrEval — первый датасет, специально разработанный для мультимодальной атрибуции в длинных документах. Датасет содержит тонкозернистые (fine-grained) аннотации, указывающие точные фрагменты исходных документов, на которые опираются компоненты ответа. Это закрывает пробел в доступных ресурсах для тестирования подобных систем.
Результаты: Скорость и точность
Эксперименты показали, что MultAttnAttrib не только повышает точность атрибуции как для унимодальных, так и для мультимодальных задач, но и делает это с беспрецедентной эффективностью. Метод сопоставим по качеству с передовыми моделями, такими как GPT-5.4, но работает значительно быстрее традиционных подходов на основе промптинга.
| Метрика / Характеристика | MultAttnAttrib | Промпт-инжиниринг (Prompting) | Frontier Models (напр., GPT-5.4) |
|---|---|---|---|
| Требует дообучения | Нет (Training-Free) | Нет | Да (обычно) |
| Задержка (Latency) | ~1/7 от промптинга | Базовая | Высокая |
| Точность атрибуции | Высокая (превосходит базовые методы) | Средняя/Высокая | Высокая (уровень SOTA) |
| Поддержка мультимодальности | Да (текст + визуал) | Да | Да |
Значение для индустрии
Работа, поданная в конференцию EMNLP 2026, демонстрирует, что эффективная верификация источников не обязательно требует ресурсоемких моделей. Использование внутренних механизмов внимания существующих LLM позволяет снизить затраты на инференс и повысить прозрачность AI-ассистентов, работающих с большими объемами мультимодальных данных.
Источник: arXiv cs.CL ↗
