Главная/Блог/Разбор/Jev 1.13 против Claude Opus 5: бенчмарк…
Разбор3 мин чтения · 22 сентября 2026 г.

Jev 1.13 против Claude Opus 5: бенчмарк классификации

Сравнение скорости, стоимости и точности Jev 1.13 и Claude Opus 5 на датасете Banking77. Как сэкономить до 95% бюджета без потери качества.

Jev 1.13 против Claude Opus 5: бенчмарк классификации

В мире LLM-инференса классификация намерений (intent classification) — одна из самых частых задач. Обычно для неё используют мощные модели вроде Claude Opus, но это дорого и медленно. Модель Jev 1.13 от TypeSafe позиционируется как легковесное решение для принятия решений. Мы разобрали реальные цифры: насколько Jev уступает флагманам и где его использование оправдано.

01Результаты бенчмарка: точность, скорость, цена

Тест проводился на датасете Banking77 (3 080 примеров, 77 намерений). Обе модели получили одинаковые однострочные описания для каждого намерения. Jev использовал Decisions API, Claude Opus 5 — строгий JSON-схем с отключенным reasoning.

Метрика Jev 1.13 Claude Opus 5
Точность (Accuracy) 81.0% 84.4%
Macro-F1 80.5% 83.6%
Задержка p50 (мс) 175 2,266
Задержка p95 (мс) 270 3,004
Стоимость за 1k запросов $0.11 $2.42

Jev быстрее Opus в ~13 раз по медианной задержке и в 22 раза дешевле. Разница в точности составляет 3.3 процентных пункта, что статистически значимо, но не критично для многих сценариев.

💡
Важно про кэширование. Цена Opus ($2.42/1k) указана с учетом prompt caching. Без кэширования система промпта (3.7к токенов) стоила бы около $19 за 1000 запросов. Всегда включайте кэширование для статических системных инструкций.

02Где модели ошибаются?

Модели согласны в 89.3% случаев. Ошибки распределены неравномерно:

  • Сильная сторона Opus: намерение receiving_money (80.0% против 52.5% у Jev). Opus лучше понимает контекст переводов.
  • Сильная сторона Jev: намерение compromised_card (95.0% против 70.0% у Opus). Opus часто путал кражу карты с неизвестным платежом.
  • Слепая зона обеих: намерение get_physical_card. Обе модели набрали 0% из-за неоднозначности названия (запрос о PIN-карте vs доставка карты). Исключение этого класса поднимает точность Jev до 82.1%, а Opus до 85.5%.

03Каскадная маршрутизация (Cascading)

Jev возвращает не только ответ, но и оценку уверенности (confidence score). Это позволяет настроить каскад: если уверенность Jev высока, ответ принимается; если низка — запрос перенаправляется на Opus.

Пример стратегии при пороге уверенности 0.90:

  • 75.9% запросов обрабатывает Jev.
  • Оставшиеся 24.1% уходят на Opus.
  • Итоговая точность: 84.0% (всего на 0.4% ниже Opus alone).
  • Стоимость: $0.69 за 1k запросов (в 3.5 раза дешевле Opus alone).
⚠️
Предупреждение. Уверенность Jev не является калиброванной вероятностью. Модель склонна переоценивать свою точность в среднем диапазоне. Используйте пороговые значения, проверенные на ваших данных.

04Как запустить тест самостоятельно

Для воспроизведения результатов используйте следующие параметры. Jev работает через Decisions API, Opus — через стандартный чат-эндпоинт с JSON-схемой.

Запрос к Jev (TypeScript/JSON):

terminaljson
{
  "model": "typeform/jev-1.13",
  "question": {
    "type": "choice",
    "options": [
      {"label": "card_arrival", "description": "..."},
      {"label": "card_delivery_estimate", "description": "..."}
    ]
  },
  "input": "When will my card arrive?"
}

Запрос к Claude Opus 5:

terminalpython
import anthropic

client = anthropic.Anthropic()

response = client.messages.create(
    model="claude-opus-5",
    max_tokens=100,
    temperature=0,
    system="Classify the intent. Options: [card_arrival, ...]",
    messages=[{"role": "user", "content": "When will my card arrive?"}],
    response_format={"type": "json_schema", "json_schema": {"name": "intent", "schema": {"type": "object", "properties": {"intent": {"type": "string", "enum": ["card_arrival", ...]}}}}}
)

05Кому подойдёт / что запустится

  • Выбирайте Jev 1.13, если: вам нужна высокая пропускная способность, низкая задержка (<200мс) и минимальная стоимость. Идеально для фильтрации простых запросов или предварительной обработки.
  • Выбирайте Claude Opus 5, если: критична максимальная точность (90%+), а бюджет позволяет платить $2-19 за 1k запросов. Лучше для сложных, неоднозначных намерений.
  • Оптимальная схема: Jev как первый фильтр. Если confidence < 0.90, отправлять на Opus. Это дает точность 84% при стоимости $0.69/1k.

Для локального запуска Jev требует специфического API от TypeSafe, тогда как Opus доступен через провайдеров вроде OpenRouter. Для РФ-практиков актуально учитывать доступность API и возможные задержки при использовании зарубежных эндпоинтов.

Источник: OpenRouter ↗