Главная/Блог/Разбор/Jev от TypeSafe AI: 20 use-cases для…
Разбор6 мин чтения · 28 сентября 2026 г.

Jev от TypeSafe AI: 20 use-cases для агентов, цены и сравнение с LLM

Разбираем System One модель Jev для типизированных решений в AI-агентах. Бенчмарки, цены, 20 сценариев использования и сравнение с Claude Opus 5.

Jev от TypeSafe AI: 20 use-cases для агентов, цены и сравнение с LLM

Типизированные решения для AI-агентов: как Jev от TypeSafe AI ускоряет маршрутизацию, безопасность и верификацию. Модель не генерирует текст, а возвращает структурированные ответы с калиброванными вероятностями, что делает её идеальной для внутренних циклов агентов.

01Как работает Jev: три примитива

Jev — это первая модель "System One" от TypeSafe AI. Она не пишет код и не ведет диалоги. Вместо этого она принимает неструктурированное состояние (текст или JSON) и возвращает типизированные решения с калиброванными вероятностями. Это позволяет использовать её для тысяч мелких суждений внутри цикла агента: выбор модели, проверка безопасности команды, релевантность passage, завершение задачи.

Каждый запрос отправляет state (текст или JSON) и словарь типизированных вопросов. TypeSafe определяет три примитива:

  • Choice: выбирает один вариант из списка, возвращая вероятность для каждого варианта и уверенность.
  • Score: оценивает состояние по упорядоченным уровням рубрики, возвращая вероятности и уверенность.
  • Noul: возвращает вероятность (от 0 до 1) того, что утверждение истинно.

Все вопросы оцениваются параллельно в одном запросе. Jev обучена с помощью Reinforcement Learning for Calibrated Decisions (RLCD), поэтому высокая уверенность должна коррелировать с высокой точностью. Choice поддерживает до 255 вариантов.

💡
Ключевое преимущество. Jev возвращает типизированные ответы Choice, Score и Noul с вероятностями, никогда не генерируя свободный текст. Это гарантирует schema-safe результаты без ошибок типа.

0220 Use-cases для AI-агентов

Jev идеально подходит для тысяч мелких решений внутри цикла агента. Вот 20 конкретных сценариев использования:

1. Маршрутизация и оркестрация

  • Model routing: Оценка сложности запроса и отправка его в быструю или сильную модель. LangChain реализует это как ModelRouterMiddleware.
  • Skill selection: Выбор одного навыка из 182 в каталоге Nous Research’s Hermes с помощью 2 запросов.
  • Typed function calling: Маппинг естественных языковых торговых запросов на имена функций и закрытые аргументы, контролируемые уверенностью.
  • Ticket triage and intent routing: Один вызов возвращает отдел, уровень фрустрации и срочность. Запрос отправляется в детерминированную логику, специализированную LLM или человека.

2. Безопасность и guardrails

  • Tool-call risk gating: pi-warden проверяет, является ли команда bash, write или edit необратимой или off-task. Например, он различает db:reset после "reset the database" и db:reset после "add a column".
  • Read-only auto-approval: jev-auto-approve — это хук для Claude Code, который автоматически одобряет только при p ≥ 0.95. В опубликованной калибровке он одобрил 0 из 8 команд, изменяющих состояние.
  • Secret-leak guard: jev-secret-guard отправляет маскированные строки в Jev и заблокировал 6 из 6 секретов и 0 из 6 доброкачественных строк.
  • Prompt-injection screening: В RAG passages cookbook косинусное сходство поставило planted injection на первое место с 0.584. Jev оценила её в 0.99 и отбросила.
  • LLM input and output guardrails: Пороги вероятности опасности для прохождения, проверки, блокировки или маршрутизации каждого сообщения.

3. Retrieval и grounding

  • Reranking: На 40 запросах CLERC legal accuracy top-1 выросла с 5% до 18%, а top-10 — с 38% до 62%.
  • Citation verification: Один Choice определяет, поддерживает ли источник раздела, противоречит или ничего не говорит о заявлении.

4. Computer, browser и real-time control

  • Browser agents: Browser Use’s Jev Ultrafast выбирает операцию и DOM-элемент в одном запросе, завершая поиск Google Flights примерно за 7.1 секунды.
  • Desktop computer use: typesafe-computer-use OCR-ит экран macOS и позволяет Jev классифицировать следующее действие примерно за $0.0002 за шаг.
  • Mobile agents: Mobile Jev принимает каждое решение Android tap, достигая экрана оплаты Uber примерно за 21 секунду и 9 действий.
  • Real-time game agents: Demo Doom запускает около 10 запросов в секунду, примерно $7 в час, на структурированном игровом состоянии.

5. Agent quality и memory

  • Loop stagnation detection: ProgressGate оценивает траекторию, и код возвращает CONTINUE, WARN, REPLAN или HALT.
  • “Done” claim verification: jev-belay проверяет транскрипт на наличие доказательств перед доверием заявлению агента Claude Code о "done".
  • Context compaction: fast-jev-compaction оценивает вызовы инструментов и отбрасывает устаревшие, а не суммирует контекст.
  • Trace mining for memory: Beacon by Asymptote Labs использует Jev для поиска, какие запуски в Claude Code, Codex, Cursor и OpenCode стоит превратить в повторно используемые навыки.
  • Semantic linting: jev-lint отмечает нарушения правил команды во время редактирования для Claude Code и Codex.
⚠️
Важно для практиков. Schema-safe не означает correct: обязательно калибруйте пороги на своем собственном трафике перед внедрением в production.

03Сравнение с конкурентами

Jev сравнивается с Laya (open), kev (open) и Claude Opus 5 (LLM). Вот ключевые метрики:

Feature Jev 1.13 (TypeSafe) Laya (open) kev (open) Claude Opus 5 (LLM)
Model type System One decision model Encoder decision model (ModernBERT-large) LoRA + readout head on Qwen2.5-0.5B Generative LLM
Weights / license Closed, hosted API Apache 2.0, 421M and 322M params Apache-2.0 (base uses Qwen license) Closed, hosted API
Choice / Score / Noul Yes Yes Yes Via structured prompting
Output guarantee Schema-bound, no type errors Typed answers over declared options Typed answers over declared options 0 of 3,080 invalid in OpenRouter test
Calibration RLCD-trained confidence Confidence returned Held-out ECE 0.065 Prompted estimates, not guaranteed calibrated
Max Choice options 255 Degrades past 50 255 n/a
Latency 70 to 500 ms (vendor); 175 ms median (OpenRouter) 32.8 ms single question, local (self-reported) ~160 ms, 6 questions, local (self-reported) 2,266 ms median (OpenRouter)
Banking77 accuracy 81.0% (OpenRouter) Not comparable (0.425 at defaults, own harness) 0.860 on 77-way (own held-out set) 84.4% (OpenRouter)
Price $0.042/MTok input, output free Free, self-hosted Free, self-hosted $2.42 per 1,000 requests vs $0.11 for Jev (OpenRouter)

На Banking77 Jev показала 81.0% против 84.4% для Claude Opus 5, при этом медианная задержка была в 13 раз ниже, а стоимость — примерно в 22 раза ниже.

04Кому подойдёт / что запустится

Jev идеально подходит для разработчиков AI-агентов, которым нужна высокая скорость и низкая стоимость для маршрутизации, гейтинга вызовов инструментов, реранкинга, проверки цитат и экранирования инъекций. Она не заменяет LLM, а дополняет их, обрабатывая ограниченные решения, такие как маршрутизация, гейтинг и верификация.

Для локального развертывания можно использовать открытые проекты, такие как Laya и kev, которые реализуют тот же интерфейс /v1/systemone на вашем собственном оборудовании. TypeSafe’s модель доступна только через API.

Ключевые выводы:

  • Jev возвращает типизированные ответы Choice, Score и Noul с вероятностями, никогда не генерируя свободный текст.
  • TypeSafe указывает $0.042 за миллион входных токенов, выходные токены бесплатны, а задержка составляет от 70 до 500 мс.
  • Лучшие use-cases: маршрутизация, гейтинг вызовов инструментов, реранкинг, проверка цитат и экранирование инъекций.
  • На Banking77 Jev показала 81.0% против 84.4% для Claude Opus 5, при этом медианная задержка была в 13 раз ниже.
  • Schema-safe не означает correct: обязательно калибруйте пороги на своем собственном трафике перед внедрением в production.

Источник: MarkTechPost ↗