Проблема: Ложные срабатывания и отсутствие аудита
По мере того как LLM-агенты получают доступ к мощным инструментам, критически важным становится обеспечение соответствия их действий намерениям пользователя. Явление, когда агент предлагает вызов инструмента, отклоняющийся от意图 пользователя, называется misalignment (рассинхронизацией). Это может привести к необратимым вредным последствиям.
Существующие runtime-guardrails часто опираются на парадигму LLM-as-a-judge (LLM как судья). Этот подход страдает от отсутствия системной рамки для рассуждений о выравнивании, что приводит к непоследовательным суждениям и сложностям в аудите решений.
Решение: ProvenanceGuard и анализ происхождения
Авторы (Yining She, Yiliang Liang, Eunsuk Kang) предлагают концептуальную основу на основе provenance analysis (анализа происхождения). Идея заключается в формализации обнаружения misalignment как проверки того, поддерживается ли предлагаемый вызов инструмента прослеживаемыми доказательствами в контексте агента.
На базе этой модели разработан ProvenanceGuard — многоэтапный конвейер, который анализирует действие агента на наличие трех типов misalignment до выполнения выбранного инструмента. Действие разрешается только в том случае, если оно считается выровненным с входным запросом пользователя.
Результаты: Сравнение с базовым уровнем
Эксперименты проводились на двух бенчмарках — Agent-SafetyBench и WorkBench — с использованием 10 различных базовых LLM. ProvenanceGuard демонстрирует статистически значимое снижение уровня ошибок по сравнению с базовым подходом LLM-as-a-judge, при этом не увеличивая количество ложных блокировок успешных задач.
| Метрика | Agent-SafetyBench | WorkBench |
|---|---|---|
| Ошибка на misaligned-трейсах (LLM-as-a-judge) | 42.9% | 32.1% |
| Ошибка на misaligned-трейсах (ProvenanceGuard) | 1.8% | 17.3% |
| Нагрузка на вмешательство (успешные трейсы, LLM-as-a-judge) | 30.5% | — |
| Нагрузка на вмешательство (успешные трейсы, ProvenanceGuard) | 12.8% | — |
Почему это важно
Результаты показывают, что структурированное рассуждение на основе происхождения данных обеспечивает эффективную и практичную основу для защиты LLM-агентов. Ключевое преимущество ProvenanceGuard — не только резкое снижение пропусков вредоносных действий (с ~43% до 1.8% на одном из бенчмарков), но и снижение ложных срабатываний на успешных задачах (с 30.5% до 12.8%), что делает систему более удобной для интеграции в реальные рабочие процессы без постоянного вмешательства человека.
Источник: arXiv cs.CL ↗
