Гибридный подход к извлечению данных
Команда во главе с Николя Тюренном (Nicolas Turenne) разработала модульный agentic-пайплайн для автоматизации работы с ботаническими описаниями. Система решает проблему неструктурированности текстов в PDF-документах, комбинируя классические методы и современные LLM. Архитектура включает четыре ключевых этапа:
- OCR и сегментация: конвертация сканов в текст и разделение контента по родам и видам.
- Rule-based парсинг: извлечение базовых структурных признаков с помощью детерминированных правил.
- LLM-обогащение: ансамбли больших языковых моделей расширяют словарь признаков и разрешают неоднозначности.
- Интеграция: семантическое связывание данных для создания интерпретируемой базы знаний.
Масштаб и метрики эффективности
Тестирование проводилось на трех региональных ботанических наборах данных. Результаты демонстрируют высокую масштабируемость подхода: система успешно обработала массивы, генерируя тысячи аннотаций на один вид. Ключевым достижением стало использование LLM для заполнения пробелов, которые не могли быть покрыты правилами.
| Метрика | Значение | Комментарий |
|---|---|---|
| Всего аннотаций | 55 737 | Объем извлеченных структурных данных |
| Обработано видов | 4 961 | Разнообразие ботанического корпуса |
| Среднее на вид | 9.1 | Плотность аннотаций |
| Рост покрытия (LLM) | +59% | Увеличение полноты данных за счет LLM |
| Видов с улучшением | 75% | Доля признаков, где LLM добавила ценность |
Устойчивость к шуму и масштабируемость
Особое внимание уделено надежности системы. Авторы отмечают, что выбор OCR-движка оказал минимальное влияние на распознавание видов, что говорит о робастности архитектуры. Даже при наличии шума во входных данных, общий счет аннотаций оставался стабильным. Это критически важно для работы с историческими или плохо отсканированными научными публикациями.
Значение для науки
Предложенный фреймворк закрывает важную нишу в области Scientific AI. Он позволяет не просто искать документы, а извлекать из них машиночитаемые знания (knowledge extraction). Это открывает путь к созданию глобальных баз данных фенотипических признаков растений, что ускорит исследования в области селекции и экологии, снизив зависимость от ручного кураторства данных.
Источник: arXiv cs.AI ↗
