Кризис доверия к LLM-as-a-Judge
В индустрии доминирует дешевый офлайн-метод оценки: персонаж-симулятор общается с агентом, а другая LLM оценивает диалог. Авторы работы GAUGE (Umesh Bodhwani, Thanh Tran, Kai Wei) доказали, что этот подход фундаментально ненадежен. Они протестировали 25 агентов от шести провайдеров на бенчмарках $\tau^2$-bench и SimulatorArena, разделив оценку на два типа валидности: ранжирование (ranking) и конструктивную валидность (construct validity).
Разрыв между «нравится» и «работает»
Главное открытие — так называемый satisfaction-success gap. Субъективное ощущение удовлетворенности пользователя практически не коррелирует с фактическим выполнением задачи. Слепая панель экспертов, оценивавшая диалоги, присваивала высокие баллы за вежливость и естественность, но эти диалоги часто были бесполезны для клиента.
| Метрика / Параметр | Значение / Наблюдение |
|---|---|
| Доля провалов задач при высоком удовлетворении | 57.5% (диалоги с высоким рейтингом не решили задачу) |
| Количество оцененных агентов | 25 (от 6 разных провайдеров) |
| Уровень несогласия в ранжировании близких агентов | 31% (при разнице в навыках менее 1%) |
| Уровень несогласия при большой разнице | <1% |
Почему это важно для разработчиков
Метод LLM-as-a-Judge работает только для грубого отбора слабых моделей. Когда вы выбираете между сильными конкурентами, «судья» теряет разрешающую способность: уровень расхождений в решениях подскакивает до 31%. Это означает, что вы можете отбросить лучшую модель, посчитав её хуже из-за шумных оценок.
Решение: Calibrate-then-Trust
Авторы предлагают отказаться от слепого доверия. Вместо этого нужно внедрять протокол calibrate-then-trust: использовать «бит завершения без судьи» (judge-free completion bit) как триггер нулевой стоимости. Если агент не может завершить задачу без внешней оценки, система должна автоматически помечать такой результат как регрессию, не полагаясь на субъективный вердикт LLM-судьи.
Источник: arXiv cs.CL ↗
