Проблема: «Кросс-источниковая контаминация»
Традиционные системы проверки фактов (RAGAS, MiniCheck, AlignScore) работают с пулом извлеченных данных как с единым контекстом. Это создает критический риск: утверждение может быть истинным, но приписано неверному источнику. Например, агент поддержки может сослаться на «запись об аккаунте», хотя информация о возврате денег содержится в «политике компании». Для медицинских или финансовых агентов такая ошибка атрибуции так же опасна, как вымышленный факт.
Решение: ProvenanceGuard
Новый метод работает как постгенеративный слой верификации поверх черных ящиков MCP-агентов. Он не переобучает модель, а анализирует захваченный трейс (trace) вызовов инструментов. Процесс включает:
- Декомпозицию: Разбор ответа на конкретные утверждения.
- Маршрутизацию: Поиск наиболее релевантного источника для каждого утверждения с помощью MiniLM.
- Проверку поддержки: Использование модели DeBERTa NLI для подтверждения факта в найденном источнике.
- Сравнение атрибуции: Сверка найденного источника с тем, на который ссылается агент.
- Ремонт (RARR): Попытка исправить ответ или вернуть безопасный фоллбэк, если утверждение ложно.
Результаты тестирования
На наборе данных из 281 реального трейса медицинского агента и экспертной выборке из 361 утверждения ProvenanceGuard показал следующие результаты:
- Поймал 138 из 139 ложных утверждений, которые эксперты сочли недопустимыми.
- Точно определил источник утверждения в 86% случаев.
- В тесте на намеренную подмену источников (50 случаев) система выявила 100% ошибок атрибуции.
- Надстройка RARR позволила разрешить все заблокированные ответы, хотя в 144 случаях из 173 система выбрала безопасный отказ от генерации вместо исправления.
Сравнение с базовыми моделями
ProvenanceGuard превосходит существующие методы не только по метрике F1 для блокировки, но и тем, что предоставляет детализированную информацию о связи «утверждение-источник», чего лишены конкуренты.
| Верификатор | Reject/Block F1 | Эмитит связь Claim-to-Source |
|---|---|---|
| ProvenanceGuard (ours) | 0.802 | Да |
| MiniCheck | 0.783 | Нет |
| RAGAS Faithfulness | 0.758 | Нет |
| AlignScore | 0.662 | Нет |
| SummaC-ZS | 0.436 | Нет |
Задержка при проверке составляет около 0.5 секунд на ответ, что делает метод пригодным для использования в качестве «оффлайн-шлюза» в чувствительных к данным средах.
Источник: Hugging Face blog ↗
