Исследования12 сентября 2026 г., 04:16 МСК🤖 Auto

LexAgentHallu: Новый бенчмарк выявил «правильные ответы с ложными причинами» в юридических AI

Исследователи представили LexAgentHallu — иерархический бенчмарк для диагностики галлюцинаций в юридических агентах, раскрывающий скрытые ошибки в многошаговых рассуждениях.

Баннер новости 7321

Проблема: галлюцинации агентов в праве

По мере внедрения больших языковых моделей (LLM) в юридическую практику, они все чаще используются как автономные агенты с доступом к инструментам. Это порождает новый тип ошибок — агентные галлюцинации, где ошибки в вызове инструментов или логических цепочках приводят к вымышленным судебным решениям (holdings) и неверным цитатам прецедентов. Существующие бенчмарки оценивали только однократные вопросы с ответами «да/нет» или точность итогового результата, игнорируя процесс рассуждения.

Решение: LexAgentHallu

Команда исследователей во главе с Юджином Чжоу (Yujin Zhou) представила LexAgentHallu — первый специализированный бенчмарк, оценивающий галлюцинации на всех этапах выполнения задачи юридическим агентом. Датасет создан с использованием конвейера с участием экспертов (expert-in-the-loop) и включает:

  • 3414 экземпляров данных;
  • 17 юридических категорий;
  • 6 типов задач;
  • Двухуровневую таксономию галлюцинаций: 7 высоких категорий и 27 детальных подклассов, охватывающих как substantive errors (ошибки в сути), так и agent-procedural failures (процедурные сбои агента).

Ключевое открытие: Right-Answer-Wrong-Reason

Оценка 18 проприетарных и open-source моделей через призму LexAgentHallu выявила критический феномен — «Правильный ответ, неверная причина» (Right-Answer-Wrong-Reason). Это означает, что агент может прийти к верному юридическому выводу, но использовать полностью сфабрикованные или неуместные прецеденты и логику. Такие ошибки невидимы при традиционной оценке точности ответа (outcome-level metrics), но крайне опасны в реальной юридической практике.

Диагностическая сила бенчмарка

Исследование показало, что галлюцинации не распределены случайно, а кластеризуются. Ошибки формируют четкие профили, зависящие от:

  • Архитектуры агента (agentic framework);
  • Типа юридической задачи;
  • Отраслевой категории права.

Разработанные метрики позволяют не только количественно оценить масштаб проблемы, но и локализовать, на каком именно шаге траектории выполнения задачи произошла ошибка. Результаты работы приняты в основной трек конференции EMNLP 2026.

Источник: arXiv cs.AI ↗