Исследования3 июля 2026 г., 18:17 МСК🤖 Auto

ProvenanceGuard: Снижение ошибок LLM-агентов с 42.9% до 1.8%

Исследователи представили ProvenanceGuard — систему защиты LLM-агентов от misalignment, которая использует анализ происхождения данных (provenance) для фильтрации вредоносных действий до их выполнения.

Баннер новости 2862

Проблема: Ложные срабатывания и отсутствие аудита

По мере того как LLM-агенты получают доступ к мощным инструментам, критически важным становится обеспечение соответствия их действий намерениям пользователя. Явление, когда агент предлагает вызов инструмента, отклоняющийся от意图 пользователя, называется misalignment (рассинхронизацией). Это может привести к необратимым вредным последствиям.

Существующие runtime-guardrails часто опираются на парадигму LLM-as-a-judge (LLM как судья). Этот подход страдает от отсутствия системной рамки для рассуждений о выравнивании, что приводит к непоследовательным суждениям и сложностям в аудите решений.

Решение: ProvenanceGuard и анализ происхождения

Авторы (Yining She, Yiliang Liang, Eunsuk Kang) предлагают концептуальную основу на основе provenance analysis (анализа происхождения). Идея заключается в формализации обнаружения misalignment как проверки того, поддерживается ли предлагаемый вызов инструмента прослеживаемыми доказательствами в контексте агента.

На базе этой модели разработан ProvenanceGuard — многоэтапный конвейер, который анализирует действие агента на наличие трех типов misalignment до выполнения выбранного инструмента. Действие разрешается только в том случае, если оно считается выровненным с входным запросом пользователя.

Результаты: Сравнение с базовым уровнем

Эксперименты проводились на двух бенчмарках — Agent-SafetyBench и WorkBench — с использованием 10 различных базовых LLM. ProvenanceGuard демонстрирует статистически значимое снижение уровня ошибок по сравнению с базовым подходом LLM-as-a-judge, при этом не увеличивая количество ложных блокировок успешных задач.

Метрика Agent-SafetyBench WorkBench
Ошибка на misaligned-трейсах (LLM-as-a-judge) 42.9% 32.1%
Ошибка на misaligned-трейсах (ProvenanceGuard) 1.8% 17.3%
Нагрузка на вмешательство (успешные трейсы, LLM-as-a-judge) 30.5%
Нагрузка на вмешательство (успешные трейсы, ProvenanceGuard) 12.8%

Почему это важно

Результаты показывают, что структурированное рассуждение на основе происхождения данных обеспечивает эффективную и практичную основу для защиты LLM-агентов. Ключевое преимущество ProvenanceGuard — не только резкое снижение пропусков вредоносных действий (с ~43% до 1.8% на одном из бенчмарков), но и снижение ложных срабатываний на успешных задачах (с 30.5% до 12.8%), что делает систему более удобной для интеграции в реальные рабочие процессы без постоянного вмешательства человека.

Источник: arXiv cs.CL ↗