Инструменты29 сентября 2026 г., 16:17 МСК🤖 Auto

ProvenanceGuard: Верификация источников для MCP-агентов

Команда MultiverseComputingCAI представила ProvenanceGuard — систему, которая проверяет не только факт, но и источник утверждения в LLM-агентах, использующих Model Context Protocol.

Баннер новости 8512

Проблема: «Кросс-источниковая контаминация»

Традиционные системы проверки фактов (RAGAS, MiniCheck, AlignScore) работают с пулом извлеченных данных как с единым контекстом. Это создает критический риск: утверждение может быть истинным, но приписано неверному источнику. Например, агент поддержки может сослаться на «запись об аккаунте», хотя информация о возврате денег содержится в «политике компании». Для медицинских или финансовых агентов такая ошибка атрибуции так же опасна, как вымышленный факт.

Решение: ProvenanceGuard

Новый метод работает как постгенеративный слой верификации поверх черных ящиков MCP-агентов. Он не переобучает модель, а анализирует захваченный трейс (trace) вызовов инструментов. Процесс включает:

  • Декомпозицию: Разбор ответа на конкретные утверждения.
  • Маршрутизацию: Поиск наиболее релевантного источника для каждого утверждения с помощью MiniLM.
  • Проверку поддержки: Использование модели DeBERTa NLI для подтверждения факта в найденном источнике.
  • Сравнение атрибуции: Сверка найденного источника с тем, на который ссылается агент.
  • Ремонт (RARR): Попытка исправить ответ или вернуть безопасный фоллбэк, если утверждение ложно.

Результаты тестирования

На наборе данных из 281 реального трейса медицинского агента и экспертной выборке из 361 утверждения ProvenanceGuard показал следующие результаты:

  • Поймал 138 из 139 ложных утверждений, которые эксперты сочли недопустимыми.
  • Точно определил источник утверждения в 86% случаев.
  • В тесте на намеренную подмену источников (50 случаев) система выявила 100% ошибок атрибуции.
  • Надстройка RARR позволила разрешить все заблокированные ответы, хотя в 144 случаях из 173 система выбрала безопасный отказ от генерации вместо исправления.

Сравнение с базовыми моделями

ProvenanceGuard превосходит существующие методы не только по метрике F1 для блокировки, но и тем, что предоставляет детализированную информацию о связи «утверждение-источник», чего лишены конкуренты.

Верификатор Reject/Block F1 Эмитит связь Claim-to-Source
ProvenanceGuard (ours) 0.802 Да
MiniCheck 0.783 Нет
RAGAS Faithfulness 0.758 Нет
AlignScore 0.662 Нет
SummaC-ZS 0.436 Нет

Задержка при проверке составляет около 0.5 секунд на ответ, что делает метод пригодным для использования в качестве «оффлайн-шлюза» в чувствительных к данным средах.

Источник: Hugging Face blog ↗