Проблема «замороженного интерфейса»
В индустрии распространена практика использования LLM-as-Judge, где модель сначала извлекает критерии и доказательства, а затем выносит вердикт. Авторы исследования предполагают, что такой подход создает «замороженный интерфейс» (frozen interface), который деградирует качество оценки. Для моделей с развитыми способностями к рассуждению (reasoning-capable) порядок видимых полей не отражает внутреннего порядка принятия решений, что приводит к потере контекста.
Методология и масштаб
Исследование проведено на базе 24 000 суждений. В качестве судей использовались флагманы Claude Sonnet 4.5 и GPT-5. Тестирование проводилось на трех ключевых датасетах: HelpSteer3, FeedbackQA и CoVal. Сравнение включало четыре сценария:
- Стандартная попарная оценка (pairwise judging).
- Структурированная оценка в один вызов (structured one-call).
- Двухэтапная фиксация доказательств (two-call evidence locking).
- Трехэтапная точечная фиксация (three-call pointwise locking).
Ключевые метрики
Результаты показали, что принудительное сохранение доказательств в отдельном вызове (evidence locking) негативно сказывается на согласии с человеческими предпочтениями. Ниже приведена сводка влияния различных методов оценки:
| Метод оценки | Влияние на согласие с людьми | Влияние на порядок ответов |
|---|---|---|
| Структурированная (1 вызов) | Базовый уровень (высокое согласие) | Базовый уровень |
| Двухэтапная фиксация (2 вызова) | Снижение на 4–6 п.п. | Рост несогласованности на 8–10 п.п. |
| Трехэтапная фиксация (3 вызова) | Вредоносное влияние (аналогично 2-этапной) | Рост несогласованности на 8–10 п.п. |
Выводы для разработчиков
Исследование подтверждает, что структурированное извлечение доказательств в рамках одного вызова остается близким к стандартной оценке по качеству. Хотя сохранение доказательств (persisted evidence) полезно для аудита и прозрачности, оно не должно заменять исходные ответы в момент принятия решения. Разделение процесса извлечения фактов и вынесения вердикта на разные вызовы API вносит шум, который современные модели (GPT-5, Claude Sonnet 4.5) не способны полностью компенсировать.
Источник: arXiv cs.CL ↗
