Проблема изолированных тестов
Систематические обзоры литературы требуют сложного человеческого суждения, но существующие оценки LLM обычно проверяют этапы по отдельности. Авторы исследования Miguel Zabaleta и Baihan Lin представили SciLitBench — многоэтапный бенчмарк, охватывающий скрининг по заголовкам/аннотациям, полный скрининг текстов и извлечение данных по схеме. Датасет включает 42 981 записей, 1 012 полных текстов и аннотации для 888 включенных статей.
Результаты скрининга: успехи
На этапе отбора статей модели показали высокую эффективность. Явное указание критериев включения и исключения улучшило метрику $F_2$ на 28.8%. Добавление обоснований (rationales), написанных исследователями, повысило точность полного скрининга еще на 15%. Это подтверждает, что LLM могут брать на себя рутинную фильтрацию тысяч записей.
Кризис извлечения данных
Самая большая проблема выявлена на этапе извлечения данных. Надежность резко падает в зависимости от типа информации. Ниже приведена сравнительная таблица точности извлечения для сильнейших моделей:
| Тип данных | Метрика / Точность | Комментарий |
|---|---|---|
| Год публикации | 0.97 (Accuracy) | Высокая надежность, простые факты |
| Вычислительный подход | 0.37 (Jaccard overlap) | Критический спад, сложная семантика |
| Доказательства эффективности | 30% извлечено | Модели пропускают 70% важных данных |
| Ограничения (Limitations) | 25% извлечено | Критическая потеря контекста |
Вывод для научного сообщества
Исследование определяет практическую границу возможностей ИИ: LLM пригодны для высокочастотного скрининга (high-recall screening), но не готовы к полному извлечению доказательной базы (evidence-complete extraction). SciLitBench предоставляет воспроизводимый ресурс для оценки LLM-ассистентов, напоминая, что автоматизация синтеза доказательств пока требует жесткого человеческого контроля.
Источник: arXiv cs.AI ↗
