Исследования18 августа 2026 г., 07:20 МСК🤖 Auto

Agentic AI для ботаники: 55K аннотаций за счет гибрида правил и LLM

Исследователи представили agentic-фреймворк, извлекающий структурные данные из научных статей. Система обработала 4961 вид растений, увеличив покрытие признаков на 59% благодаря LLM.

Баннер новости 5967

Гибридный подход к извлечению данных

Команда во главе с Николя Тюренном (Nicolas Turenne) разработала модульный agentic-пайплайн для автоматизации работы с ботаническими описаниями. Система решает проблему неструктурированности текстов в PDF-документах, комбинируя классические методы и современные LLM. Архитектура включает четыре ключевых этапа:

  • OCR и сегментация: конвертация сканов в текст и разделение контента по родам и видам.
  • Rule-based парсинг: извлечение базовых структурных признаков с помощью детерминированных правил.
  • LLM-обогащение: ансамбли больших языковых моделей расширяют словарь признаков и разрешают неоднозначности.
  • Интеграция: семантическое связывание данных для создания интерпретируемой базы знаний.

Масштаб и метрики эффективности

Тестирование проводилось на трех региональных ботанических наборах данных. Результаты демонстрируют высокую масштабируемость подхода: система успешно обработала массивы, генерируя тысячи аннотаций на один вид. Ключевым достижением стало использование LLM для заполнения пробелов, которые не могли быть покрыты правилами.

Метрика Значение Комментарий
Всего аннотаций 55 737 Объем извлеченных структурных данных
Обработано видов 4 961 Разнообразие ботанического корпуса
Среднее на вид 9.1 Плотность аннотаций
Рост покрытия (LLM) +59% Увеличение полноты данных за счет LLM
Видов с улучшением 75% Доля признаков, где LLM добавила ценность

Устойчивость к шуму и масштабируемость

Особое внимание уделено надежности системы. Авторы отмечают, что выбор OCR-движка оказал минимальное влияние на распознавание видов, что говорит о робастности архитектуры. Даже при наличии шума во входных данных, общий счет аннотаций оставался стабильным. Это критически важно для работы с историческими или плохо отсканированными научными публикациями.

Значение для науки

Предложенный фреймворк закрывает важную нишу в области Scientific AI. Он позволяет не просто искать документы, а извлекать из них машиночитаемые знания (knowledge extraction). Это открывает путь к созданию глобальных баз данных фенотипических признаков растений, что ускорит исследования в области селекции и экологии, снизив зависимость от ручного кураторства данных.

Источник: arXiv cs.AI ↗