Проблема низкоресурсных языков в юриспруденции
Для языков с малым объемом обучающих данных, таких как тулу (дрравидаческая группа), модели И часто используют более ресурсоемкие языки-«костыли» для понимания контекста. Авторы исследования (Sindhu Shetty, Spurthi Setty, Natan Vidra) протестировали три модели — Llama3, Hex-1 и Sarvam — на способности классифицировать юридические жалобы на тулу. Ключевой вопрос: насколько эффективно работает перенос знаний между языками и как RAG (Retrieval-Augmented Generation) влияет на точность?
Роль скрипта: Каннада vs Тулу
Использование транслитерации запросов между скриптами дравидаских языков позволило моделям получить предварительное понимание жалоб без масштабного обучения. Однако результат оказался строго зависимым от скрипта. Наиболее сильный положительный тренд показала каннада (еще один низкоресурсный язык), что указывает на тесную лингвистическую связь, помогающую модели «схватить» суть, даже если она не обучалась на тулу напрямую.
Парадокс RAG: от помощи к хаосу
Подключение RAG-фреймворка с базой юридических документов на каннаде дало смешанные результаты. В то время как некоторые модели показали слабый рост точности в определенных условиях, при сбоях возникали два критических типа ошибок:
- Substitution (Подмена фактов): Модель фиксировалась на конкретных фрагментах извлеченных текстов, что искажало логику рассуждений.
- Confabulation (Конфабуляция): Генерация вымышленных фактов, не имеющих оснований ни в запросе, ни в корпусе документов.
Главный вывод: проблема в парсинге, а не в данных
Исследование показывает, что в низкоресурсных доменах источник ошибок — не отсутствие данных в корпусе, а неспособность модели корректно распарсить информацию и построить цепочку рассуждений. Устойчивость RAG и понимание, зависящее от скрипта, тесно связаны. Авторы внедрили фреймворк «статистической честности» и анализ трассировки рассуждений, которые могут стать стандартом для оценки многоязычных RAG-систем.
| Модель | Результат с RAG (Каннада-корпус) | Основной тип ошибки при сбое |
|---|---|---|
| Llama3 | Смешанные результаты | Подмена фактов / Конфабуляция |
| Hex-1 | Смешанные результаты | Подмена фактов / Конфабуляция |
| Sarvam | Смешанные результаты | Подмена фактов / Конфабуляция |
Почему это важно для AI-разработчиков
Если вы строите юридические или медицинские чат-боты для регионов с низкоресурсными языками, простое добавление RAG не гарантирует точность. Исследование подчеркивает необходимость внедрения механизмов проверки «честности» рассуждений (reasoning-trace analysis) до того, как модель начнет генерировать ответы, основанные на искаженном контексте.
Источник: arXiv cs.CL ↗
