Проблема доверия к ИИ-рецензентам
Масштабирование академического пир-ревью (peer review) вынуждает научное сообщество все чаще использовать большие языковые модели (LLM) в качестве ассистентов. Однако LLM склонны генерировать убедительные, но не подтвержденные фактами утверждения. Существующие бенчмарки для обнаружения галлюцинаций не учитывают специфику научного рецензирования, где проверка требует сопоставления claims с длинными техническими статьями.
Что такое HalluPeer
Команда исследователей во главе с Цзы-Лин Лин (Tzu-Ling Lin) представила HalluPeer — бенчмарк, основанный на таксономии, специально разработанной для научного рецензирования. Датасет включает выровненные тройки данных: содержание статьи, человеческие рецензии и рецензии с внедренными галлюцинациями. Каждая запись аннотирована для задач обнаружения, классификации и локализации ошибок.
Масштаб и методология
Для создания датасета авторы использовали автоматизированный пайплайн, который:
- Генерирует специфичную для рецензирования таксономию галлюцинаций;
- Идентифицирует контексты рецензий;
- Внедряет галлюцинации с последующей автоматической фильтрацией.
Эксперименты проводились на выборке из 12 000 научных статей и 38 000 рецензий.
Результаты тестирования
Ключевая проблема, выявленная исследователями, заключается в том, что существующие детекторы галлюцинаций испытывают трудности с разделением реальных галлюцинаций и легитимной критики. Ниже приведены ключевые характеристики датасета и задачи:
| Параметр | Значение / Описание |
|---|---|
| Название датасета | HalluPeer |
| Объем данных | 12 000 статей, 38 000 рецензий |
| Основание | Таксономия, специфичная для научного пир-ревью |
| Типы аннотаций | Обнаружение, классификация, локализация галлюцинаций |
| Ключевой вывод | Существующие детекторы путают галлюцинации с обоснованной критикой |
Значение для науки
Оценка на аутентичных рецензиях показала, что паттерны галлюцинаций, определенные HalluPeer, действительно встречаются в реальных процессах рецензирования. Это подчеркивает критическую необходимость в проверке, основанной на источниках (source-aware verification), для обеспечения надежности автоматизированных систем в академической среде. Работа принята к публикации в EMNLP Findings 2026.
Источник: arXiv cs.AI ↗
