Исследования3 июля 2026 г., 23:16 МСК🤖 Auto

MultAttnAttrib: Атрибуция ответов без дообучения за 1/7 времени

Исследователи представили MultAttnAttrib — метод атрибуции источников в мультимодальных QA-системах, который работает без дообучения, превосходит промптинг и сопоставим с GPT-5.4.

Баннер новости 2880

Проблема доверия в мультимодальных системах

По мере внедрения систем вопрос-ответ (QA), опирающихся на внешние знания, критически важным становится не только качество ответа, но и возможность точно указать, какая часть текста или изображения стала источником информации. В то время как для текстовых данных (унимодальных) методы атрибуции уже хорошо изучены, мультимодальные сценарии (текст + изображения/графики в длинных документах) остаются «темной материей» AI-исследований. Отсутствие надежных инструментов для верификации источников снижает доверие пользователей и повышает риски галлюцинаций.

Решение: MultAttnAttrib

Команда исследователей во главе с Dang Quang Thien Tran представила MultAttnAttrib — метод, который не требует дообучения модели (training-free). Алгоритм использует данные из этапа префайла (prefill pass) трансформера, анализируя активность определенных attention-голов и применяя калиброванные пороги для локализации источников внутри длинных документов. Это позволяет системе «понимать», откуда она взяла информацию, без дополнительных вычислительных затрат на генерацию.

Новый бенчмарк: MultAttrEval

Для оценки метода авторы создали MultAttrEval — первый датасет, специально разработанный для мультимодальной атрибуции в длинных документах. Датасет содержит тонкозернистые (fine-grained) аннотации, указывающие точные фрагменты исходных документов, на которые опираются компоненты ответа. Это закрывает пробел в доступных ресурсах для тестирования подобных систем.

Результаты: Скорость и точность

Эксперименты показали, что MultAttnAttrib не только повышает точность атрибуции как для унимодальных, так и для мультимодальных задач, но и делает это с беспрецедентной эффективностью. Метод сопоставим по качеству с передовыми моделями, такими как GPT-5.4, но работает значительно быстрее традиционных подходов на основе промптинга.

Метрика / Характеристика MultAttnAttrib Промпт-инжиниринг (Prompting) Frontier Models (напр., GPT-5.4)
Требует дообучения Нет (Training-Free) Нет Да (обычно)
Задержка (Latency) ~1/7 от промптинга Базовая Высокая
Точность атрибуции Высокая (превосходит базовые методы) Средняя/Высокая Высокая (уровень SOTA)
Поддержка мультимодальности Да (текст + визуал) Да Да

Значение для индустрии

Работа, поданная в конференцию EMNLP 2026, демонстрирует, что эффективная верификация источников не обязательно требует ресурсоемких моделей. Использование внутренних механизмов внимания существующих LLM позволяет снизить затраты на инференс и повысить прозрачность AI-ассистентов, работающих с большими объемами мультимодальных данных.

Источник: arXiv cs.CL ↗