Автоматическая оценка ответов AI-агентов (LLM-as-a-Judge) стала стандартом индустрии. Однако подход TypeSafe с использованием модели принятия решений Jev предлагает альтернативу, которая меняет парадигму: вместо генерации текста вердикта Jev возвращает вероятности для строго типизированных вопросов. Разберем, где Jev превосходит классические LLM-судьи, а где они остаются незаменимыми, опираясь на реальные бенчмарки.
01Два разных подхода к оценке
Классический LLM-as-a-Judge — это генеративная модель. Вы даете ей рубрику и ответ, а она генерирует текст вердикта (или JSON). Даже «уверенность» (confidence) — это просто число, которое модель решила написать, а не измеренная статистическая величина. Это делает такие оценки трудно проверяемыми и плохо подходящими для маршрутизации (routing).
Jev — это модель принятия решений (decision model). Вы задаете вопрос с фиксированным набором ответов, и модель возвращает вероятность для каждого исхода. Это позволяет точно калибровать пороги принятия решений и маршрутизировать сомнительные случаи на человека.
Примеры запросов для разных типов вопросов:
- Noul (Yes/No): «Подтверждается ли ответ фактами?». Возвращает вероятность
true. - Choice: Выбор одного из N вариантов. Возвращает вероятности по каждому варианту.
- Score: Оценка по шкале (например, 1-5). Возвращает распределение вероятностей по уровням.
02Методология сравнения
Сравнение проводилось на двух публичных датасетах через OpenRouter. Общая стоимость запуска составила $0.041.
| Датасет | Задача | Объем | Тип рубрики |
|---|---|---|---|
| HaluEval (Faithfulness) | Проверка фактологической точности ответа относительно короткого passage | 88 items (после очистки) | Закрытая (еvidence present) |
| SummEval (Summary) | Оценка связности и согласованности саммари с длинной статьей | 50 items (10 статей × 5 суммари) | Открытая (long-context) |
Модели:
- Jev:
typesafe/jev-1.13(решениеtypesafe/jev-1.13-20260917). - LLM Judge:
~openai/gpt-luna-latest(решениеopenai/gpt-5.6-luna),temperature: 0, вывод в JSON.
03Точность и калибровка
На датасете Faithfulness (88 элементов) обе модели показали практически одинаковую точность. Однако точность — плохая метрика для оценки качества вероятностных оценок.
Здесь вступает в игру Brier Score (среднеквадратичная ошибка между предсказанной вероятностью и истинным значением 0 или 1). Чем ниже, тем лучше. Jev показал значительно лучший результат по этому показателю.
Разница видна в таблице надежности (reliability). Jev корректно обрабатывает «серую зону»:
- Случаи с промежуточной вероятностью у Jev оказались верными в пропорции, соответствующей их вероятности.
- Случаи с высокой вероятностью у Jev оказались истинно положительными в подавляющем большинстве.
LLM-судья же демонстрирует бинарную уверенность. Его confidence принимает ограниченный набор значений. Он не умеет говорить «я не уверен». Даже в ошибках он уверен на высоком уровне, что делает невозможной надежную маршрутизацию сомнительных ответов.
04Стоимость и задержка (Latency)
Разница в производительности критична для интеграции в реальный пайплайн (request path).
| Метрика | Jev | LLM Judge | Отношение |
|---|---|---|---|
| Стоимость (на 1000 оценок) | $0.021 | $0.114 | Jev в 5.4 раза дешевле |
| Медианная задержка | 171 мс | 1,662 мс | Jev в 9.7 раз быстрее |
Для ночных eval-ов разница в стоимости не важна. Но если Jev работает как gate внутри запроса пользователя, задержка в 170 мс приемлема, а 1.6 секунды от LLM может стать узким местом.
05Устойчивость к предвзятости
Обе модели показали устойчивость к классическим предвзятостям LLM-судей:
- Position Bias: Предпочтение первому показанному ответу.
- Length Bias: Предпочтение более длинному ответу.
Jev показал slightly лучшую устойчивость, но оба судьи успешно сопротивлялись этим искажениям в тестовых сценариях.
06Кому подойдёт / что запустится
Выбор зависит от типа задачи и доступных ресурсов:
- Используйте Jev, если:
- Рубрика закрытая (еvidence present): проверка фактов, on-policy, соответствие справочнику.
- Нужна маршрутизация (routing) или фильтрация по порогу (threshold). <
Источник: OpenRouter ↗
