Исследования14 июля 2026 г., 05:16 МСК🤖 Auto

PRecG: Графы и риторика для точного поиска прецедентов

Индийские исследователи представили PRecG — систему поиска судебных прецедентов, которая анализирует риторическую структуру документов, а не просто ищет семантическое сходство.

Баннер новости 3503

Проблема монолитного текста

Традиционные системы автоматического поиска правовых прецедентов (Legal Precedent Retrieval) часто рассматривают судебные решения как единый монолитный текст. Они сводят документы к векторам в низкоразмерном семантическом пространстве, вычисляя сходство на основе близости этих представлений. Такой подход игнорирует риторическую организацию юридических текстов, из-за чего теряются тонкие смысловые нюансы и контекстуальная значимость юридических сущностей, которые меняются в зависимости от их роли в документе.

Архитектура PRecG: от сегментов к графам

Команда авторов (Devanshu Verma, Vasudha Bhatnagar, Vikas Kumar, Balaji Ganesan) предложила конвейер PRecG, который вычисляет сходство пар судебных решений через иерархическое обучение представлений. Процесс состоит из трех ключевых этапов:

  • Сегментация: Документ разбивается на семантические единицы (сегменты) на основе риторических ролей предложений.
  • Графовое моделирование: Для каждого риторического сегмента строится граф знаний, фиксирующий юридические сущности и связи между ними. Контекстуальные представления сущностей агрегируются для получения эмбеддингов уровня сегмента.
  • Агрегация: Эмбеддинги сегментов интегрируются в единое представление документа, после чего вычисляется финальное семантическое сходство пары документов.

Результаты на индийской правовой базе

Эксперименты проводились на бенчмарке индийских судебных данных. Метод PRecG демонстрирует эффективность в сравнении с современными базовыми моделями (SOTA baselines), доказывая, что учет риторической структуры улучшает точность поиска релевантных прецедентов. Это критически важно для подготовки дел, планирования стратегии litigation и юридических исследований.

Компонент системы Функция Влияние на результат
Риторическая сегментация Разделение текста на логические блоки Сохранение контекста юридических понятий
Граф знаний (Knowledge Graph) Фиксация связей между сущностями Учет структурных отношений, а не только слов
Иерархическая агрегация Объединение сегментов в документ Формирование целостного представления дела

Значение для LegalTech

Публикация arXiv:2607.09094 (подана 10 июля 2026 года) указывает на сдвиг в сторону более интерпретируемых и структурно-осознанных моделей в юридическом ИИ. Вместо «черного ящика» семантического поиска, PRecG предлагает прозрачный механизм, основанный на логике юридического аргументирования, что снижает риск галлюцинаций и повышает доверие к автоматизированным рекомендациям.

Источник: arXiv cs.CL ↗