Главная/Блог/Разбор/Jev vs LLM-as-a-Judge: Бенчмарк…
Разбор3 мин чтения · 23 сентября 2026 г.

Jev vs LLM-as-a-Judge: Бенчмарк скорости, цены и калибровки

Сравнение генеративного LLM-судьи и детерминированного Jev. Jev в 5 раз дешевле, в 10 раз быстрее и лучше калиброван для закрытых рубрик, но LLM выигрывает в работе с длинным контекстом.

Jev vs LLM-as-a-Judge: Бенчмарк скорости, цены и калибровки

Автоматическая оценка ответов AI-агентов (LLM-as-a-Judge) стала стандартом индустрии. Однако подход TypeSafe с использованием модели принятия решений Jev предлагает альтернативу, которая меняет парадигму: вместо генерации текста вердикта Jev возвращает вероятности для строго типизированных вопросов. Разберем, где Jev превосходит классические LLM-судьи, а где они остаются незаменимыми, опираясь на реальные бенчмарки.

01Два разных подхода к оценке

Классический LLM-as-a-Judge — это генеративная модель. Вы даете ей рубрику и ответ, а она генерирует текст вердикта (или JSON). Даже «уверенность» (confidence) — это просто число, которое модель решила написать, а не измеренная статистическая величина. Это делает такие оценки трудно проверяемыми и плохо подходящими для маршрутизации (routing).

Jev — это модель принятия решений (decision model). Вы задаете вопрос с фиксированным набором ответов, и модель возвращает вероятность для каждого исхода. Это позволяет точно калибровать пороги принятия решений и маршрутизировать сомнительные случаи на человека.

Примеры запросов для разных типов вопросов:

  • Noul (Yes/No): «Подтверждается ли ответ фактами?». Возвращает вероятность true.
  • Choice: Выбор одного из N вариантов. Возвращает вероятности по каждому варианту.
  • Score: Оценка по шкале (например, 1-5). Возвращает распределение вероятностей по уровням.
💡
Ключевое отличие. Вероятность в Jev — это claim о частоте событий, который можно проверить. Если калибровка верна, вы можете установить порог (threshold) и маршрутизировать сомнительные случаи на проверку человеку, минимизируя ошибки.

02Методология сравнения

Сравнение проводилось на двух публичных датасетах через OpenRouter. Общая стоимость запуска составила $0.041.

Датасет Задача Объем Тип рубрики
HaluEval (Faithfulness) Проверка фактологической точности ответа относительно короткого passage 88 items (после очистки) Закрытая (еvidence present)
SummEval (Summary) Оценка связности и согласованности саммари с длинной статьей 50 items (10 статей × 5 суммари) Открытая (long-context)

Модели:

  • Jev: typesafe/jev-1.13 (решение typesafe/jev-1.13-20260917).
  • LLM Judge: ~openai/gpt-luna-latest (решение openai/gpt-5.6-luna), temperature: 0, вывод в JSON.

03Точность и калибровка

На датасете Faithfulness (88 элементов) обе модели показали практически одинаковую точность. Однако точность — плохая метрика для оценки качества вероятностных оценок.

Здесь вступает в игру Brier Score (среднеквадратичная ошибка между предсказанной вероятностью и истинным значением 0 или 1). Чем ниже, тем лучше. Jev показал значительно лучший результат по этому показателю.

Разница видна в таблице надежности (reliability). Jev корректно обрабатывает «серую зону»:

  • Случаи с промежуточной вероятностью у Jev оказались верными в пропорции, соответствующей их вероятности.
  • Случаи с высокой вероятностью у Jev оказались истинно положительными в подавляющем большинстве.

LLM-судья же демонстрирует бинарную уверенность. Его confidence принимает ограниченный набор значений. Он не умеет говорить «я не уверен». Даже в ошибках он уверен на высоком уровне, что делает невозможной надежную маршрутизацию сомнительных ответов.

⚠️
Важно для продакшена. Если вам нужна маршрутизация (routing) или фильтрация по порогу, LLM-as-a-Judge не подходит из-за плохой калибровки. Используйте Jev для закрытых критериев.

04Стоимость и задержка (Latency)

Разница в производительности критична для интеграции в реальный пайплайн (request path).

Метрика Jev LLM Judge Отношение
Стоимость (на 1000 оценок) $0.021 $0.114 Jev в 5.4 раза дешевле
Медианная задержка 171 мс 1,662 мс Jev в 9.7 раз быстрее

Для ночных eval-ов разница в стоимости не важна. Но если Jev работает как gate внутри запроса пользователя, задержка в 170 мс приемлема, а 1.6 секунды от LLM может стать узким местом.

05Устойчивость к предвзятости

Обе модели показали устойчивость к классическим предвзятостям LLM-судей:

  • Position Bias: Предпочтение первому показанному ответу.
  • Length Bias: Предпочтение более длинному ответу.

Jev показал slightly лучшую устойчивость, но оба судьи успешно сопротивлялись этим искажениям в тестовых сценариях.

06Кому подойдёт / что запустится

Выбор зависит от типа задачи и доступных ресурсов:

  • Используйте Jev, если:
    • Рубрика закрытая (еvidence present): проверка фактов, on-policy, соответствие справочнику.
    • Нужна маршрутизация (routing) или фильтрация по порогу (threshold).
    • <

      Источник: OpenRouter ↗