Проблема монолитного текста
Традиционные системы автоматического поиска правовых прецедентов (Legal Precedent Retrieval) часто рассматривают судебные решения как единый монолитный текст. Они сводят документы к векторам в низкоразмерном семантическом пространстве, вычисляя сходство на основе близости этих представлений. Такой подход игнорирует риторическую организацию юридических текстов, из-за чего теряются тонкие смысловые нюансы и контекстуальная значимость юридических сущностей, которые меняются в зависимости от их роли в документе.
Архитектура PRecG: от сегментов к графам
Команда авторов (Devanshu Verma, Vasudha Bhatnagar, Vikas Kumar, Balaji Ganesan) предложила конвейер PRecG, который вычисляет сходство пар судебных решений через иерархическое обучение представлений. Процесс состоит из трех ключевых этапов:
- Сегментация: Документ разбивается на семантические единицы (сегменты) на основе риторических ролей предложений.
- Графовое моделирование: Для каждого риторического сегмента строится граф знаний, фиксирующий юридические сущности и связи между ними. Контекстуальные представления сущностей агрегируются для получения эмбеддингов уровня сегмента.
- Агрегация: Эмбеддинги сегментов интегрируются в единое представление документа, после чего вычисляется финальное семантическое сходство пары документов.
Результаты на индийской правовой базе
Эксперименты проводились на бенчмарке индийских судебных данных. Метод PRecG демонстрирует эффективность в сравнении с современными базовыми моделями (SOTA baselines), доказывая, что учет риторической структуры улучшает точность поиска релевантных прецедентов. Это критически важно для подготовки дел, планирования стратегии litigation и юридических исследований.
| Компонент системы | Функция | Влияние на результат |
|---|---|---|
| Риторическая сегментация | Разделение текста на логические блоки | Сохранение контекста юридических понятий |
| Граф знаний (Knowledge Graph) | Фиксация связей между сущностями | Учет структурных отношений, а не только слов |
| Иерархическая агрегация | Объединение сегментов в документ | Формирование целостного представления дела |
Значение для LegalTech
Публикация arXiv:2607.09094 (подана 10 июля 2026 года) указывает на сдвиг в сторону более интерпретируемых и структурно-осознанных моделей в юридическом ИИ. Вместо «черного ящика» семантического поиска, PRecG предлагает прозрачный механизм, основанный на логике юридического аргументирования, что снижает риск галлюцинаций и повышает доверие к автоматизированным рекомендациям.
Источник: arXiv cs.CL ↗
