Исследования10 сентября 2026 г., 10:17 МСК🤖 Auto

SciLitBench: LLM-экстракция данных — узкое место ИИ в науке

Новый бенчмарк SciLitBench показал, что LLM отлично фильтруют статьи, но катастрофически проваливают извлечение данных: точность падает с 97% до 37%.

Баннер новости 7152

Проблема изолированных тестов

Систематические обзоры литературы требуют сложного человеческого суждения, но существующие оценки LLM обычно проверяют этапы по отдельности. Авторы исследования Miguel Zabaleta и Baihan Lin представили SciLitBench — многоэтапный бенчмарк, охватывающий скрининг по заголовкам/аннотациям, полный скрининг текстов и извлечение данных по схеме. Датасет включает 42 981 записей, 1 012 полных текстов и аннотации для 888 включенных статей.

Результаты скрининга: успехи

На этапе отбора статей модели показали высокую эффективность. Явное указание критериев включения и исключения улучшило метрику $F_2$ на 28.8%. Добавление обоснований (rationales), написанных исследователями, повысило точность полного скрининга еще на 15%. Это подтверждает, что LLM могут брать на себя рутинную фильтрацию тысяч записей.

Кризис извлечения данных

Самая большая проблема выявлена на этапе извлечения данных. Надежность резко падает в зависимости от типа информации. Ниже приведена сравнительная таблица точности извлечения для сильнейших моделей:

Тип данных Метрика / Точность Комментарий
Год публикации 0.97 (Accuracy) Высокая надежность, простые факты
Вычислительный подход 0.37 (Jaccard overlap) Критический спад, сложная семантика
Доказательства эффективности 30% извлечено Модели пропускают 70% важных данных
Ограничения (Limitations) 25% извлечено Критическая потеря контекста

Вывод для научного сообщества

Исследование определяет практическую границу возможностей ИИ: LLM пригодны для высокочастотного скрининга (high-recall screening), но не готовы к полному извлечению доказательной базы (evidence-complete extraction). SciLitBench предоставляет воспроизводимый ресурс для оценки LLM-ассистентов, напоминая, что автоматизация синтеза доказательств пока требует жесткого человеческого контроля.

Источник: arXiv cs.AI ↗