В мире LLM-инференса классификация намерений (intent classification) — одна из самых частых задач. Обычно для неё используют мощные модели вроде Claude Opus, но это дорого и медленно. Модель Jev 1.13 от TypeSafe позиционируется как легковесное решение для принятия решений. Мы разобрали реальные цифры: насколько Jev уступает флагманам и где его использование оправдано.
01Результаты бенчмарка: точность, скорость, цена
Тест проводился на датасете Banking77 (3 080 примеров, 77 намерений). Обе модели получили одинаковые однострочные описания для каждого намерения. Jev использовал Decisions API, Claude Opus 5 — строгий JSON-схем с отключенным reasoning.
| Метрика | Jev 1.13 | Claude Opus 5 |
|---|---|---|
| Точность (Accuracy) | 81.0% | 84.4% |
| Macro-F1 | 80.5% | 83.6% |
| Задержка p50 (мс) | 175 | 2,266 |
| Задержка p95 (мс) | 270 | 3,004 |
| Стоимость за 1k запросов | $0.11 | $2.42 |
Jev быстрее Opus в ~13 раз по медианной задержке и в 22 раза дешевле. Разница в точности составляет 3.3 процентных пункта, что статистически значимо, но не критично для многих сценариев.
02Где модели ошибаются?
Модели согласны в 89.3% случаев. Ошибки распределены неравномерно:
- Сильная сторона Opus: намерение
receiving_money(80.0% против 52.5% у Jev). Opus лучше понимает контекст переводов. - Сильная сторона Jev: намерение
compromised_card(95.0% против 70.0% у Opus). Opus часто путал кражу карты с неизвестным платежом. - Слепая зона обеих: намерение
get_physical_card. Обе модели набрали 0% из-за неоднозначности названия (запрос о PIN-карте vs доставка карты). Исключение этого класса поднимает точность Jev до 82.1%, а Opus до 85.5%.
03Каскадная маршрутизация (Cascading)
Jev возвращает не только ответ, но и оценку уверенности (confidence score). Это позволяет настроить каскад: если уверенность Jev высока, ответ принимается; если низка — запрос перенаправляется на Opus.
Пример стратегии при пороге уверенности 0.90:
- 75.9% запросов обрабатывает Jev.
- Оставшиеся 24.1% уходят на Opus.
- Итоговая точность: 84.0% (всего на 0.4% ниже Opus alone).
- Стоимость: $0.69 за 1k запросов (в 3.5 раза дешевле Opus alone).
04Как запустить тест самостоятельно
Для воспроизведения результатов используйте следующие параметры. Jev работает через Decisions API, Opus — через стандартный чат-эндпоинт с JSON-схемой.
Запрос к Jev (TypeScript/JSON):
{
"model": "typeform/jev-1.13",
"question": {
"type": "choice",
"options": [
{"label": "card_arrival", "description": "..."},
{"label": "card_delivery_estimate", "description": "..."}
]
},
"input": "When will my card arrive?"
}Запрос к Claude Opus 5:
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-opus-5",
max_tokens=100,
temperature=0,
system="Classify the intent. Options: [card_arrival, ...]",
messages=[{"role": "user", "content": "When will my card arrive?"}],
response_format={"type": "json_schema", "json_schema": {"name": "intent", "schema": {"type": "object", "properties": {"intent": {"type": "string", "enum": ["card_arrival", ...]}}}}}
)05Кому подойдёт / что запустится
- Выбирайте Jev 1.13, если: вам нужна высокая пропускная способность, низкая задержка (<200мс) и минимальная стоимость. Идеально для фильтрации простых запросов или предварительной обработки.
- Выбирайте Claude Opus 5, если: критична максимальная точность (90%+), а бюджет позволяет платить $2-19 за 1k запросов. Лучше для сложных, неоднозначных намерений.
- Оптимальная схема: Jev как первый фильтр. Если confidence < 0.90, отправлять на Opus. Это дает точность 84% при стоимости $0.69/1k.
Для локального запуска Jev требует специфического API от TypeSafe, тогда как Opus доступен через провайдеров вроде OpenRouter. Для РФ-практиков актуально учитывать доступность API и возможные задержки при использовании зарубежных эндпоинтов.
Источник: OpenRouter ↗
