Проблема текущих LLM-рецензентов
Автоматизация рецензирования сталкивается с двумя структурными барьерами. Традиционные модели напрямую мапят текст статьи в вердикт, скрывая логику оценки. Существующие подходы делятся на два типа: training-free агенты собирают широкий спектр доказательств, но выдают размытые критические замечания, а обученные модели наследуют человеческие предубеждения и шум. Ни один из подходов не обеспечивает полной объективности.
Архитектура RubricReviewer
Новая система внедряет явный промежуточный этап — генерацию адаптивного рубрика (списка критериев). Процесс разделен на два модуля:
- Scout (Разведчик): Training-free агент, отвечающий за сбор внешних доказательств и фактов.
- Aligner (Выравниватель): Обученная модель, которая потребляет собранные доказательства и формирует итоговую оценку на основе сгенерированного рубрика.
Результаты и метрики
Эксперименты на реальных публикациях показали, что RubricReviewer превосходит аналоги по трем ключевым параметрам: полноте охвата темы, дискриминативности (способности различать качество) и устойчивости. Система демонстрирует максимальную надежность против adversarial prompt-injection атак.
| Компонент | Роль в системе | Ключевое преимущество |
|---|---|---|
| Scout | Сбор внешних доказательств | Широкий охват фактов без предвзятости |
| Aligner | Анализ и вердикт | Человеко-ориентированная оценка |
| Rubric | Явные критерии | Объективность и воспроизводимость |
Значение для индустрии
Исследование подтверждает необходимость разделения процессов «поиска» и «суждения» в LLM. Ablation studies доказали, что каждый компонент архитектуры критически важен для достижения итогового качества, открывая путь к созданию более прозрачных систем автоматического рецензирования.
Источник: arXiv cs.CL ↗
