Исследования8 августа 2026 г., 08:17 МСК🤖 Auto

LLM-судьи теряют точность: почему «заморозка» доказательств вредит оценке

Исследование Divyansh Singh показало, что принудительное сохранение доказательств в отдельном вызове API снижает согласие LLM-судей с человеческими предпочтениями на 4–6%.

Баннер новости 5362

Проблема «замороженного интерфейса»

В индустрии распространена практика использования LLM-as-Judge, где модель сначала извлекает критерии и доказательства, а затем выносит вердикт. Авторы исследования предполагают, что такой подход создает «замороженный интерфейс» (frozen interface), который деградирует качество оценки. Для моделей с развитыми способностями к рассуждению (reasoning-capable) порядок видимых полей не отражает внутреннего порядка принятия решений, что приводит к потере контекста.

Методология и масштаб

Исследование проведено на базе 24 000 суждений. В качестве судей использовались флагманы Claude Sonnet 4.5 и GPT-5. Тестирование проводилось на трех ключевых датасетах: HelpSteer3, FeedbackQA и CoVal. Сравнение включало четыре сценария:

  • Стандартная попарная оценка (pairwise judging).
  • Структурированная оценка в один вызов (structured one-call).
  • Двухэтапная фиксация доказательств (two-call evidence locking).
  • Трехэтапная точечная фиксация (three-call pointwise locking).

Ключевые метрики

Результаты показали, что принудительное сохранение доказательств в отдельном вызове (evidence locking) негативно сказывается на согласии с человеческими предпочтениями. Ниже приведена сводка влияния различных методов оценки:

Метод оценки Влияние на согласие с людьми Влияние на порядок ответов
Структурированная (1 вызов) Базовый уровень (высокое согласие) Базовый уровень
Двухэтапная фиксация (2 вызова) Снижение на 4–6 п.п. Рост несогласованности на 8–10 п.п.
Трехэтапная фиксация (3 вызова) Вредоносное влияние (аналогично 2-этапной) Рост несогласованности на 8–10 п.п.

Выводы для разработчиков

Исследование подтверждает, что структурированное извлечение доказательств в рамках одного вызова остается близким к стандартной оценке по качеству. Хотя сохранение доказательств (persisted evidence) полезно для аудита и прозрачности, оно не должно заменять исходные ответы в момент принятия решения. Разделение процесса извлечения фактов и вынесения вердикта на разные вызовы API вносит шум, который современные модели (GPT-5, Claude Sonnet 4.5) не способны полностью компенсировать.

Источник: arXiv cs.CL ↗