Исследования11 сентября 2026 г., 11:20 МСК🤖 Auto

ContractEval: Как найти скрытые ошибки в LLM-агентах

Исследователи представили ContractEval — фреймворк, который выявляет структурные провалы в работе LLM-агентов, когда итоговый ответ выглядит корректно, но процесс его получения нарушал инструкции.

Баннер новости 7257

Проблема «ложной успешности»

По мере того как большие языковые модели (LLM) переходят от простого ответа на вопросы к выполнению сложных процедур, возникает новая проблема: незаслуженные успехи. Агенты могут пропускать проверки, ветвления, зависимости или инварианты, заложенные в инструкцию. При этом финальный ответ выглядит приемлемым, что делает традиционные методы оценки неэффективными.

Стандартная оценка «только по ответу» (output-only) и оценка, основанная на анализе действий (trace-aware), не способны определить, какие именно обязательства были активны для конкретного запроса. В результате системные ошибки остаются незамеченными.

Решение: ContractEval

Авторы (Praphul Singh, Shanu Kumar, Akshat Agarwal, Ganesh Kumar) представили ContractEval — диагностический фреймворк, который делает явными «активные обязательства» (query-active obligations). Система представляет процедурные инструкции в виде контрактов и сопоставляет их с доказательствами из ответа или лога выполнения (trace).

Метод позволяет классифицировать нарушения на конкретные типы:

  • Пропуски действий (omissions)
  • Выбор неверной ветви логики
  • Нарушение порядка выполнения
  • Лишние действия
  • Нарушение инвариантов
  • Нарушение контракта вывода

Результаты тестирования

На контролируемом наборе данных с аудированными процедурными контрактами исследователи сравнили эффективность ContractEval с традиционными подходами. Ключевой вывод: стандартные LLM-судьи (LLM judges) пропускают множество внедренных структурных сбоев, тогда как ContractEval обнаруживает и локализует их все при наличии «золотых» ожидаемых и наблюдаемых графов.

Метод оценки Способность выявлять структурные сбои Ограничения
Output-only (только ответ) Низкая Не видит процесс, только финальный результат
Trace-aware (анализ действий) Средняя Не идентифицирует активные обязательства для конкретного запроса
ContractEval Высокая (100% детекция на тестовом наборе) Требует явного определения контрактов; LLM-экстракция чувствительна к калибровке

Значение для индустрии

ContractEval не является гарантией соблюдения合规 (compliance), но он делает процедурное соответствие аудируемым, а не скрытым за качеством финального ответа. Это критически важно для внедрения LLM-агентов в сферы, где важна не только точность результата, но и корректность соблюдения регламентов (финансы, юриспруденция, медицина).

Исследование показывает, что даже при использовании LLM для извлечения сигналов о соблюдении контрактов, сохраняется зависимость от калибровки модели, что указывает на необходимость дальнейшей работы над надежностью таких систем.

Источник: arXiv cs.AI ↗