Исследования30 июля 2026 г., 08:19 МСК🤖 Auto

LLM-рецензент: ИИ проверяет, доказывают ли методы заявленные новизны

Исследователи представили систему Intra-Paper Verification, которая использует LLM для выявления разрыва между заявленными новинками в статье и реальными экспериментами, обучаясь на рецензиях ICLR 2025.

Баннер новости 4695

Проблема автоматизации рецензирования научных статей часто сводится к проверке новизны: сравнивают ли работу с существующей литературой. Однако исследователи из команды Ranjitha Shivaprasad Ballakuraya отмечают, что человеческие рецензенты чаще всего отклоняют работы не из-за плагиата идей, а из-за того, что методология не подтверждает заявленных результатов. Для решения этой проблемы они разработали фреймворк Intra-Paper Verification, который оценивает внутреннюю согласованность статьи.

Как работает система

Алгоритм выполняет трехэтапный анализ текста:

  • Извлечение: LLM идентифицирует заявления о новизне (novelty claims) в разделе введения.
  • Поиск: Система находит методологические доказательства в теле статьи, релевантные этим заявлениям.
  • Оценка: Проверяется, действительно ли описанные методы и эксперименты обосновывают заявленные вклады.

Ключевая особенность подхода — критерии оценки. Они были выведены индуктивно из анализа рецензий на 182 статьи ICLR 2025. Это позволяет ИИ формировать структурированные комментарии, имитирующие стиль и озабоченности человеческих экспертов, фокусируясь на новизне, методологии и ясности изложения.

Результаты валидации

Авторы протестировали фреймворк на сбалансированном наборе принятых и отклоненных статей. Сравнение с человеческими рецензиями показало высокую степень совпадения, особенно в вопросах, касающихся новизны. Для количественной оценки использовалась метрика BERTScore, которая успешно отделяла пары «человек-ИИ» с совпадающими выводами от случайных контрольных пар.

Аспект оценки Источник данных Результат применения
Критерии рецензирования 182 рецензии ICLR 2025 Выявлены типичные проблемы: несоответствие методов заявкам, неясность логики
Метрика качества BERTScore Показала статистически значимое сходство выводов ИИ и экспертов-людей
Фокус проверки Внутренняя согласованность Выявление разрыва между «что заявлено» и «что сделано»

Почему это важно

Текущие системы автоматического рецензирования часто работают как «поисковики новизны», игнорируя качество реализации. Данный подход смещает фокус на достоверность доказательной базы. Это критически важно для научного сообщества, так как позволяет отсеивать работы с «пустыми» заявлениями еще на этапе предварительной оценки, разгружая экспертов от рутинной проверки логических связей в тексте.

Источник: arXiv cs.CL ↗