Проблема «ложной успешности»
По мере того как большие языковые модели (LLM) переходят от простого ответа на вопросы к выполнению сложных процедур, возникает новая проблема: незаслуженные успехи. Агенты могут пропускать проверки, ветвления, зависимости или инварианты, заложенные в инструкцию. При этом финальный ответ выглядит приемлемым, что делает традиционные методы оценки неэффективными.
Стандартная оценка «только по ответу» (output-only) и оценка, основанная на анализе действий (trace-aware), не способны определить, какие именно обязательства были активны для конкретного запроса. В результате системные ошибки остаются незамеченными.
Решение: ContractEval
Авторы (Praphul Singh, Shanu Kumar, Akshat Agarwal, Ganesh Kumar) представили ContractEval — диагностический фреймворк, который делает явными «активные обязательства» (query-active obligations). Система представляет процедурные инструкции в виде контрактов и сопоставляет их с доказательствами из ответа или лога выполнения (trace).
Метод позволяет классифицировать нарушения на конкретные типы:
- Пропуски действий (omissions)
- Выбор неверной ветви логики
- Нарушение порядка выполнения
- Лишние действия
- Нарушение инвариантов
- Нарушение контракта вывода
Результаты тестирования
На контролируемом наборе данных с аудированными процедурными контрактами исследователи сравнили эффективность ContractEval с традиционными подходами. Ключевой вывод: стандартные LLM-судьи (LLM judges) пропускают множество внедренных структурных сбоев, тогда как ContractEval обнаруживает и локализует их все при наличии «золотых» ожидаемых и наблюдаемых графов.
| Метод оценки | Способность выявлять структурные сбои | Ограничения |
|---|---|---|
| Output-only (только ответ) | Низкая | Не видит процесс, только финальный результат |
| Trace-aware (анализ действий) | Средняя | Не идентифицирует активные обязательства для конкретного запроса |
| ContractEval | Высокая (100% детекция на тестовом наборе) | Требует явного определения контрактов; LLM-экстракция чувствительна к калибровке |
Значение для индустрии
ContractEval не является гарантией соблюдения合规 (compliance), но он делает процедурное соответствие аудируемым, а не скрытым за качеством финального ответа. Это критически важно для внедрения LLM-агентов в сферы, где важна не только точность результата, но и корректность соблюдения регламентов (финансы, юриспруденция, медицина).
Исследование показывает, что даже при использовании LLM для извлечения сигналов о соблюдении контрактов, сохраняется зависимость от калибровки модели, что указывает на необходимость дальнейшей работы над надежностью таких систем.
Источник: arXiv cs.AI ↗
