Суть проблемы: «Угадывание» вместо анализа
Традиционные юридические бенчмарки оценивают модели только по финальному ответу, игнорируя наличие ссылок на нормативные акты. Исследование Hsien-Jyh Liao (arXiv:2608.02621) показало, что это создает ложное ощущение надежности. При тестировании на 238 вопросах из экзамена на адвоката Тайваня (без специальных запросов цитирования) четыре крупные LLM спонтанно начали указывать правовые нормы. Однако анализ выявил сильную диссоциацию: правильность ответа и наличие авторитетного источника не коррелируют.
Ключевые метрики расхождений
Автоматический аудит показал, что модели часто «знают форму, но не функцию» права. В уголовном праве наблюдается два типа ошибок, которые стандартные метрики пропускают:
| Тип расхождения | Диапазон значений | Суть проблемы |
|---|---|---|
| Верный ответ, нет ссылки | 24.0% – 42.4% | Модель угадала или сделала вывод, но не привела закон. Это считается успехом в старых бенчмарках. |
| Неверный ответ, есть ссылка | 15.2% – 21.7% | Модель привела верную статью, но сделала неверный вывод. Это считается провалом, но с «хорошим» обоснованием. |
Почему это опасно для внедрения
Проблема усугубляется тем, что расхождение возникает при обычных промптах, без adversarial-атак. Если система оценивает только финальный ответ, она маркирует случаи, когда модель не привела закон, как полные успехи. Это критично для юриспруденции, где верифицируемость источника так же важна, как и сам вердикт. Исследование подтверждает, что извлечение статута возможно автоматически, так как оно структурно выделено в тексте.
Глобальный контекст и выводы
Авторы протестировали гипотезу на расширенном наборе данных по гражданскому праву КНР, где также зафиксировано спонтанное цитирование без запроса. Это указывает на то, что проблема не ограничена одной юрисдикцией. Исследование предлагает переход к совместной оценке (joint answer–authority evaluation), где модель должна быть одинаково точна как в выборе ответа, так и в подборе нормативной базы.
Источник: arXiv cs.CL ↗
