Исследования1 сентября 2026 г., 14:18 МСК🤖 Auto

LLM-рецензенты не видят ошибок: аудит Qwen2.5 и Pixtral на ICLR 2026

Исследование показало, что мультимодальные LLM (Qwen2.5-VL-72B и Pixtral-Large-124B) систематически завышают оценки рецензий и пропускают 78% ошибок, даже при прямых инструкциях.

Баннер новости 6493

Суть эксперимента: LLM против реального пир-ревью

Исследователь Эмад Альхарби провел масштабный аудит двух передовых мультимодальных моделей — Qwen2.5-VL-72B и Pixtral-Large-124B — на реальных материалах конференции ICLR 2026 (International Conference on Learning Representations). Важно, что ICLR 2026 выходит за рамки обучающих выборок обеих моделей, что делает тестирование объективным.

Моделям были предоставлены 165 заявок. Чтобы проверить влияние контекста, исследователи манипулировали двумя факторами: анонимностью авторов (заменяли реальные аффилиации на престижные или малоизвестные) и форматом ввода (только текст или текст с рисунками). Также в 55 рукописей были намеренно внедрены 145 верифицируемых ошибок.

Ключевые метрики: завышение оценок и слепота к ошибкам

Главный вывод исследования — LLM демонстрируют критическую некалиброванность. Они склонны давать высокие оценки независимо от качества работы, при этом визуальный контент не помогает, а мешает точности.

Метрика LLM (Qwen2.5 / Pixtral) Человеческие рецензенты Комментарий
Диапазон оценок 7.0 – 8.1 3.4 – 6.8 Модели систематически завышают баллы
Обнаружение ошибок (естественный промпт) 12.1% Большинство ошибок остаются незамеченными
Обнаружение ошибок (с инструкцией) 22.2% Рост незначителен, 78% ошибок пропущены
Влияние рисунков Снижение обнаружения ошибок Добавление изображений ухудшает анализ

Мифы о предвзятости и визуальном анализе

Исследование опровергло несколько распространенных опасений по поводу ИИ-рецензентов:

  • Эффект имени отсутствует: Замена аффилиаций авторов на престижные или низкие не повлияла ни на оценки, ни на способность находить ошибки. LLM «слепы» к статусу авторов.
  • Иллюзия понимания визуала: Ни одна визуальная ошибка не была надежно верифицирована. Более того, половина рецензий, сгенерированных на основе текста без рисунков, содержала описания несуществующих изображений. Это указывает на галлюцинации, а не на анализ.

Вывод для научного сообщества

Решения редакторов, основанные на LLM, полностью совпадали с простым усреднением оценок. Модели не «скрупулезно проверяют» (scrutinize) то, что рецензируют. Они генерируют гладкий, высокооцененный текст, но не способны выполнять функцию критического фильтра, которую выполняет человек. Использование таких моделей в качестве основного фильтра для научных статей несет риски пропуска серьезных методологических ошибок.

Источник: arXiv cs.CL ↗