Типизированные решения для AI-агентов: как Jev от TypeSafe AI ускоряет маршрутизацию, безопасность и верификацию. Модель не генерирует текст, а возвращает структурированные ответы с калиброванными вероятностями, что делает её идеальной для внутренних циклов агентов.
01Как работает Jev: три примитива
Jev — это первая модель "System One" от TypeSafe AI. Она не пишет код и не ведет диалоги. Вместо этого она принимает неструктурированное состояние (текст или JSON) и возвращает типизированные решения с калиброванными вероятностями. Это позволяет использовать её для тысяч мелких суждений внутри цикла агента: выбор модели, проверка безопасности команды, релевантность passage, завершение задачи.
Каждый запрос отправляет state (текст или JSON) и словарь типизированных вопросов. TypeSafe определяет три примитива:
- Choice: выбирает один вариант из списка, возвращая вероятность для каждого варианта и уверенность.
- Score: оценивает состояние по упорядоченным уровням рубрики, возвращая вероятности и уверенность.
- Noul: возвращает вероятность (от 0 до 1) того, что утверждение истинно.
Все вопросы оцениваются параллельно в одном запросе. Jev обучена с помощью Reinforcement Learning for Calibrated Decisions (RLCD), поэтому высокая уверенность должна коррелировать с высокой точностью. Choice поддерживает до 255 вариантов.
0220 Use-cases для AI-агентов
Jev идеально подходит для тысяч мелких решений внутри цикла агента. Вот 20 конкретных сценариев использования:
1. Маршрутизация и оркестрация
- Model routing: Оценка сложности запроса и отправка его в быструю или сильную модель. LangChain реализует это как
ModelRouterMiddleware. - Skill selection: Выбор одного навыка из 182 в каталоге Nous Research’s Hermes с помощью 2 запросов.
- Typed function calling: Маппинг естественных языковых торговых запросов на имена функций и закрытые аргументы, контролируемые уверенностью.
- Ticket triage and intent routing: Один вызов возвращает отдел, уровень фрустрации и срочность. Запрос отправляется в детерминированную логику, специализированную LLM или человека.
2. Безопасность и guardrails
- Tool-call risk gating:
pi-wardenпроверяет, является ли команда bash, write или edit необратимой или off-task. Например, он различаетdb:resetпосле "reset the database" иdb:resetпосле "add a column". - Read-only auto-approval:
jev-auto-approve— это хук для Claude Code, который автоматически одобряет только при p ≥ 0.95. В опубликованной калибровке он одобрил 0 из 8 команд, изменяющих состояние. - Secret-leak guard:
jev-secret-guardотправляет маскированные строки в Jev и заблокировал 6 из 6 секретов и 0 из 6 доброкачественных строк. - Prompt-injection screening: В RAG passages cookbook косинусное сходство поставило planted injection на первое место с 0.584. Jev оценила её в 0.99 и отбросила.
- LLM input and output guardrails: Пороги вероятности опасности для прохождения, проверки, блокировки или маршрутизации каждого сообщения.
3. Retrieval и grounding
- Reranking: На 40 запросах CLERC legal accuracy top-1 выросла с 5% до 18%, а top-10 — с 38% до 62%.
- Citation verification: Один
Choiceопределяет, поддерживает ли источник раздела, противоречит или ничего не говорит о заявлении.
4. Computer, browser и real-time control
- Browser agents: Browser Use’s
Jev Ultrafastвыбирает операцию и DOM-элемент в одном запросе, завершая поиск Google Flights примерно за 7.1 секунды. - Desktop computer use:
typesafe-computer-useOCR-ит экран macOS и позволяет Jev классифицировать следующее действие примерно за $0.0002 за шаг. - Mobile agents:
Mobile Jevпринимает каждое решение Android tap, достигая экрана оплаты Uber примерно за 21 секунду и 9 действий. - Real-time game agents: Demo
Doomзапускает около 10 запросов в секунду, примерно $7 в час, на структурированном игровом состоянии.
5. Agent quality и memory
- Loop stagnation detection:
ProgressGateоценивает траекторию, и код возвращает CONTINUE, WARN, REPLAN или HALT. - “Done” claim verification:
jev-belayпроверяет транскрипт на наличие доказательств перед доверием заявлению агента Claude Code о "done". - Context compaction:
fast-jev-compactionоценивает вызовы инструментов и отбрасывает устаревшие, а не суммирует контекст. - Trace mining for memory:
Beacon by Asymptote Labsиспользует Jev для поиска, какие запуски в Claude Code, Codex, Cursor и OpenCode стоит превратить в повторно используемые навыки. - Semantic linting:
jev-lintотмечает нарушения правил команды во время редактирования для Claude Code и Codex.
03Сравнение с конкурентами
Jev сравнивается с Laya (open), kev (open) и Claude Opus 5 (LLM). Вот ключевые метрики:
| Feature | Jev 1.13 (TypeSafe) | Laya (open) | kev (open) | Claude Opus 5 (LLM) |
|---|---|---|---|---|
| Model type | System One decision model | Encoder decision model (ModernBERT-large) | LoRA + readout head on Qwen2.5-0.5B | Generative LLM |
| Weights / license | Closed, hosted API | Apache 2.0, 421M and 322M params | Apache-2.0 (base uses Qwen license) | Closed, hosted API |
| Choice / Score / Noul | Yes | Yes | Yes | Via structured prompting |
| Output guarantee | Schema-bound, no type errors | Typed answers over declared options | Typed answers over declared options | 0 of 3,080 invalid in OpenRouter test |
| Calibration | RLCD-trained confidence | Confidence returned | Held-out ECE 0.065 | Prompted estimates, not guaranteed calibrated |
| Max Choice options | 255 | Degrades past 50 | 255 | n/a |
| Latency | 70 to 500 ms (vendor); 175 ms median (OpenRouter) | 32.8 ms single question, local (self-reported) | ~160 ms, 6 questions, local (self-reported) | 2,266 ms median (OpenRouter) |
| Banking77 accuracy | 81.0% (OpenRouter) | Not comparable (0.425 at defaults, own harness) | 0.860 on 77-way (own held-out set) | 84.4% (OpenRouter) |
| Price | $0.042/MTok input, output free | Free, self-hosted | Free, self-hosted | $2.42 per 1,000 requests vs $0.11 for Jev (OpenRouter) |
На Banking77 Jev показала 81.0% против 84.4% для Claude Opus 5, при этом медианная задержка была в 13 раз ниже, а стоимость — примерно в 22 раза ниже.
04Кому подойдёт / что запустится
Jev идеально подходит для разработчиков AI-агентов, которым нужна высокая скорость и низкая стоимость для маршрутизации, гейтинга вызовов инструментов, реранкинга, проверки цитат и экранирования инъекций. Она не заменяет LLM, а дополняет их, обрабатывая ограниченные решения, такие как маршрутизация, гейтинг и верификация.
Для локального развертывания можно использовать открытые проекты, такие как Laya и kev, которые реализуют тот же интерфейс /v1/systemone на вашем собственном оборудовании. TypeSafe’s модель доступна только через API.
Ключевые выводы:
- Jev возвращает типизированные ответы Choice, Score и Noul с вероятностями, никогда не генерируя свободный текст.
- TypeSafe указывает $0.042 за миллион входных токенов, выходные токены бесплатны, а задержка составляет от 70 до 500 мс.
- Лучшие use-cases: маршрутизация, гейтинг вызовов инструментов, реранкинг, проверка цитат и экранирование инъекций.
- На Banking77 Jev показала 81.0% против 84.4% для Claude Opus 5, при этом медианная задержка была в 13 раз ниже.
- Schema-safe не означает correct: обязательно калибруйте пороги на своем собственном трафике перед внедрением в production.
Источник: MarkTechPost ↗
