Исследования1 сентября 2026 г., 08:18 МСК🤖 Auto

InternReviewer: RL-агенты для рецензирования с защитой от галлюцинаций

Исследователи представили фреймворк InternReviewer и InternAdvocate, использующий агентный RL для объективной оценки научных статей и написания ответов.

Баннер новости 6471

Проблема субъективности в AI-рецензировании

Генерация профессиональных научных текстов, таких как рецензии (peer reviews) и ответы на рецензии (rebuttals), требует сложного сочетания предметного анализа и фактологической точности. Традиционные методы оценки часто страдают от субъективности. Авторы работы — Сюй Жуй Су, Ли Я Гэо и команда из 6 соавторов — предлагают решение, основанное на агентном обучении с подкреплением (Agentic Reinforcement Learning).

Архитектура и инструменты

Система состоит из двух специализированных агентов:

  • InternReviewer: Анализирует статью и формирует рецензию.
  • InternAdvocate: Генерирует ответ автора на замечания рецензента.

Ключевым элементом является интеграция высокоэффективного инструмента извлечения данных из arXiv, который позволяет агентам активно собирать доказательства и проверять факты в реальном времени.

Метрика вознаграждения (Reward System)

Для оптимизации моделей используется единая объективная метрика, которая избегает предвзятости субъективных судейских систем. Система вознаграждения базируется на трех измерениях:

  1. Семантическое выравнивание: Опора на эталонные тексты (reference-anchored).
  2. Структурное соответствие: Соблюдение форматов научных рецензий.
  3. Строгая верификация: Перекрестная проверка цитат против реальных журналов взаимодействия (interaction logs) для полного исключения галлюцинаций.

Результаты экспериментов

Эксперименты в замкнутом цикле показали значительное улучшение глубины рассуждений и точности цитирования. Ниже приведена структура оценки эффективности подхода:

Критерий оценки Метод реализации Цель
Объективность Agentic RL с единой метрикой Устранение субъективности LLM-судей
Точность фактов Проверка по логам arXiv Устранение галлюцинаций в цитатах
Качество аргументации Reference-anchored alignment Глубина семантического анализа

Значение для индустрии

Работа, опубликованная 21 июля 2026 года (arXiv:2608.28612), демонстрирует переход от простой генерации текста к созданию автономных агентов, способных к верифицируемому научному диалогу. Это критически важно для автоматизации процессов публичного рецензирования и ускорения научного обмена.

Источник: arXiv cs.AI ↗