Проблема субъективности в AI-рецензировании
Генерация профессиональных научных текстов, таких как рецензии (peer reviews) и ответы на рецензии (rebuttals), требует сложного сочетания предметного анализа и фактологической точности. Традиционные методы оценки часто страдают от субъективности. Авторы работы — Сюй Жуй Су, Ли Я Гэо и команда из 6 соавторов — предлагают решение, основанное на агентном обучении с подкреплением (Agentic Reinforcement Learning).
Архитектура и инструменты
Система состоит из двух специализированных агентов:
- InternReviewer: Анализирует статью и формирует рецензию.
- InternAdvocate: Генерирует ответ автора на замечания рецензента.
Ключевым элементом является интеграция высокоэффективного инструмента извлечения данных из arXiv, который позволяет агентам активно собирать доказательства и проверять факты в реальном времени.
Метрика вознаграждения (Reward System)
Для оптимизации моделей используется единая объективная метрика, которая избегает предвзятости субъективных судейских систем. Система вознаграждения базируется на трех измерениях:
- Семантическое выравнивание: Опора на эталонные тексты (reference-anchored).
- Структурное соответствие: Соблюдение форматов научных рецензий.
- Строгая верификация: Перекрестная проверка цитат против реальных журналов взаимодействия (interaction logs) для полного исключения галлюцинаций.
Результаты экспериментов
Эксперименты в замкнутом цикле показали значительное улучшение глубины рассуждений и точности цитирования. Ниже приведена структура оценки эффективности подхода:
| Критерий оценки | Метод реализации | Цель |
|---|---|---|
| Объективность | Agentic RL с единой метрикой | Устранение субъективности LLM-судей |
| Точность фактов | Проверка по логам arXiv | Устранение галлюцинаций в цитатах |
| Качество аргументации | Reference-anchored alignment | Глубина семантического анализа |
Значение для индустрии
Работа, опубликованная 21 июля 2026 года (arXiv:2608.28612), демонстрирует переход от простой генерации текста к созданию автономных агентов, способных к верифицируемому научному диалогу. Это критически важно для автоматизации процессов публичного рецензирования и ускорения научного обмена.
Источник: arXiv cs.AI ↗
