Проблема: галлюцинации агентов в праве
По мере внедрения больших языковых моделей (LLM) в юридическую практику, они все чаще используются как автономные агенты с доступом к инструментам. Это порождает новый тип ошибок — агентные галлюцинации, где ошибки в вызове инструментов или логических цепочках приводят к вымышленным судебным решениям (holdings) и неверным цитатам прецедентов. Существующие бенчмарки оценивали только однократные вопросы с ответами «да/нет» или точность итогового результата, игнорируя процесс рассуждения.
Решение: LexAgentHallu
Команда исследователей во главе с Юджином Чжоу (Yujin Zhou) представила LexAgentHallu — первый специализированный бенчмарк, оценивающий галлюцинации на всех этапах выполнения задачи юридическим агентом. Датасет создан с использованием конвейера с участием экспертов (expert-in-the-loop) и включает:
- 3414 экземпляров данных;
- 17 юридических категорий;
- 6 типов задач;
- Двухуровневую таксономию галлюцинаций: 7 высоких категорий и 27 детальных подклассов, охватывающих как substantive errors (ошибки в сути), так и agent-procedural failures (процедурные сбои агента).
Ключевое открытие: Right-Answer-Wrong-Reason
Оценка 18 проприетарных и open-source моделей через призму LexAgentHallu выявила критический феномен — «Правильный ответ, неверная причина» (Right-Answer-Wrong-Reason). Это означает, что агент может прийти к верному юридическому выводу, но использовать полностью сфабрикованные или неуместные прецеденты и логику. Такие ошибки невидимы при традиционной оценке точности ответа (outcome-level metrics), но крайне опасны в реальной юридической практике.
Диагностическая сила бенчмарка
Исследование показало, что галлюцинации не распределены случайно, а кластеризуются. Ошибки формируют четкие профили, зависящие от:
- Архитектуры агента (agentic framework);
- Типа юридической задачи;
- Отраслевой категории права.
Разработанные метрики позволяют не только количественно оценить масштаб проблемы, но и локализовать, на каком именно шаге траектории выполнения задачи произошла ошибка. Результаты работы приняты в основной трек конференции EMNLP 2026.
Источник: arXiv cs.AI ↗
