Исследования14 сентября 2026 г., 07:19 МСК🤖 Auto

LLM-фильтр для данных: новый метод извлечения ссылок в гуманитарных отчетах

Исследователи представили слабоконтролируемый фреймворк, использующий LLM для уточнения аннотаций, что позволило достичь 74.1% точности в извлечении упоминаний датасетов из документов по вынужденной миграции.

Баннер новости 7421

Проблема: разрозненные данные в гуманитарной сфере

Организации, занимающиеся вопросами вынужденного перемещения и конфликтов (FCV — Fragile, Conflict, and Violence), генерируют огромные объемы данных. Однако ссылки на эти наборы данных (датасеты) разбросаны по научным статьям, проектной документации и отчетам. Систематически отслеживать использование этих данных и выявлять пробелы в их доступности вручную практически невозможно из-за неструктурированного характера текстов.

Решение: слабоконтролируемое обучение с LLM

Команда авторов (Rafael Macalaba, Aivin V. Solatorio и др.) предложила метод, не требующий создания больших размеченных корпусов. Процесс состоит из трех этапов:

  • Генерация кандидатов: Легковесная модель, предварительно обученная на общей научной литературе, сканирует непомеченные документы и выделяет потенциальные упоминания датасетов.
  • Уточнение LLM: Фронтальная большая языковая модель (LLM) анализирует контекст, подтверждая или отвергая кандидаты, а также корректируя границы извлечения.
  • Дообучение: Полученные аннотации дополняются синтетическими примерами и используются для тонкой настройки легковесной модели для масштабного извлечения.

Результаты на бенчмарке

Модель была протестирована на независимом золотом стандарте, состоящем из 1 706 текстовых фрагментов. Метрики показали высокую эффективность, особенно в контексте, где упоминания действительно присутствуют:

Метрика Значение Примечание
Точность (Precision) 74.1% На всем бенчмарке
Полнота (Recall) 70.5% На всем бенчмарке
Точность (Precision) 89.5% В фрагментах с упоминаниями
Точность (Accuracy) 88.2% На уровне фрагмента (passage)
Специфичность (Specificity) 88.6% На уровне фрагмента (passage)

Значение для отрасли

Подход демонстрирует практическую возможность создания доменно-специфичного обучения в условиях дефицита размеченных данных. Это создает техническую основу для крупномасштабного анализа использования данных и выявления пробелов в ландшафте данных о вынужденной миграции, что критически важно для планирования гуманитарных операций и политики.

Источник: arXiv cs.CL ↗