Исследования14 сентября 2026 г., 08:18 МСК🤖 Auto

GAUGE: Почему LLM-судьи врут при оценке агентов (57.5% провалов)

Исследование GAUGE (EMNLP 2026) вскрыло критический разрыв между субъективным удовлетворением пользователя и реальным успехом задачи: 57.5% диалогов с высоким рейтингом заканчивались провалом.

Баннер новости 7424

Кризис доверия к LLM-as-a-Judge

В индустрии доминирует дешевый офлайн-метод оценки: персонаж-симулятор общается с агентом, а другая LLM оценивает диалог. Авторы работы GAUGE (Umesh Bodhwani, Thanh Tran, Kai Wei) доказали, что этот подход фундаментально ненадежен. Они протестировали 25 агентов от шести провайдеров на бенчмарках $\tau^2$-bench и SimulatorArena, разделив оценку на два типа валидности: ранжирование (ranking) и конструктивную валидность (construct validity).

Разрыв между «нравится» и «работает»

Главное открытие — так называемый satisfaction-success gap. Субъективное ощущение удовлетворенности пользователя практически не коррелирует с фактическим выполнением задачи. Слепая панель экспертов, оценивавшая диалоги, присваивала высокие баллы за вежливость и естественность, но эти диалоги часто были бесполезны для клиента.

Метрика / Параметр Значение / Наблюдение
Доля провалов задач при высоком удовлетворении 57.5% (диалоги с высоким рейтингом не решили задачу)
Количество оцененных агентов 25 (от 6 разных провайдеров)
Уровень несогласия в ранжировании близких агентов 31% (при разнице в навыках менее 1%)
Уровень несогласия при большой разнице <1%

Почему это важно для разработчиков

Метод LLM-as-a-Judge работает только для грубого отбора слабых моделей. Когда вы выбираете между сильными конкурентами, «судья» теряет разрешающую способность: уровень расхождений в решениях подскакивает до 31%. Это означает, что вы можете отбросить лучшую модель, посчитав её хуже из-за шумных оценок.

Решение: Calibrate-then-Trust

Авторы предлагают отказаться от слепого доверия. Вместо этого нужно внедрять протокол calibrate-then-trust: использовать «бит завершения без судьи» (judge-free completion bit) как триггер нулевой стоимости. Если агент не может завершить задачу без внешней оценки, система должна автоматически помечать такой результат как регрессию, не полагаясь на субъективный вердикт LLM-судьи.

Источник: arXiv cs.CL ↗