Что такое Jev и почему это не просто еще одна LLM
Компания TypeSafe AI, основанная бывшим исследователем OpenAI Диого Алмейдой, представила Jev — первую модель архитектуры System One. В отличие от генеративных языковых моделей, Jev не пишет код, не ведет диалоги и не суммирует текст. Ее единственная задача — принимать типизированные решения на основе неструктурированного состояния (текст или JSON) и возвращать вероятности с калиброванной уверенностью.
Модель использует три базовых примитива, работающих параллельно в одном запросе:
- Choice: Выбор одного варианта из списка (до 255 опций) с вероятностью для каждого.
- Score: Оценка состояния по упорядоченной шкале (rubric levels).
- Noul: Вероятность (0–1) того, что утверждение истинно.
Обучение проводится методом RLCD (Reinforcement Learning for Calibrated Decisions), что гарантирует корреляцию между заявленной уверенностью модели и фактической точностью.
Производительность и экономика: сравнение с лидерами
По данным TypeSafe, Jev работает в 193.6 раза быстрее и в 444.6 раза дешевле по сравнению с эталонными моделями GPT-6 Astra и Fable 5.1 в сценариях оценки рабочих процессов. На платформе OpenRouter модель демонстрирует медианную задержку 175 мс, что в 13 раз быстрее Claude Opus 5 (2266 мс), при этом стоимость составляет около 1/22 от цены Claude.
| Характеристика | Jev 1.13 (TypeSafe) | Claude Opus 5 (LLM) | Laya (Open Source) |
|---|---|---|---|
| Тип модели | System One decision model | Generative LLM | Encoder decision model |
| Задержка (медиана) | 175 мс (OpenRouter) | 2,266 мс (OpenRouter) | 32.8 мс (локально) |
| Точность (Banking77) | 81.0% | 84.4% | 0.425 (по умолчанию) |
| Стоимость | $0.042/MTok (вход), 0 (выход) | $2.42 за 1000 запросов | Бесплатно (self-hosted) |
| Макс. опций (Choice) | 255 | n/a | Деградирует после 50 |
20 сценариев использования в Agentic AI
Jev позиционируется как «клей» для AI-агентов, берущий на себя рутинные бинарные и мультиклассовые решения. Вот ключевые кейсы:
- Маршрутизация и оркестрация: Оценка сложности запроса для отправки в быструю или сильную модель (ModelRouterMiddleware). Выбор навыка из каталога из 182 опций (Nous Research Hermes) всего за 2 запроса.
- Безопасность и Guardrails: Фильтрация рискованных вызовов инструментов (например, различение
db:resetиdb:resetпосле добавления колонки). Блокировка утечек секретов (6 из 6 заблокировано в тестах) и защита от prompt-injection (оценка 0.99 для вредоносных вставок). - Retrieval и Grounding: Улучшение точности поиска (Reranking) с 5% до 18% (top-1) на юридических запросах CLERC. Проверка цитирования источников.
- Управление состоянием: Обнаружение стагнации цикла агента (ProgressGate), проверка утверждений «задача выполнена» (jev-belay) и сжатие контекста путем отбрасывания устаревших вызовов инструментов.
- Контроль устройств: Управление браузером (поиск авиабилетов за ~7.1 сек), десктопом ($0.0002 за шаг) и мобильными устройствами (Uber-платеж за ~21 сек).
Важно для разработчиков
Jev не заменяет LLM, а дополняет их. Языковые модели планируют и генерируют, а Jev обрабатывает ограниченные решения. Важно помнить: schema-safe не означает correct. Разработчикам необходимо калибровать пороги уверенности (thresholds) на собственных данных, так как модель обучена на калибровке, а не на универсальной логике. Для локального развертывания аналогов можно использовать open-source проекты Laya и kev, поддерживающие интерфейс /v1/systemone.
Бенчмарки
| Бенчмарк | Jev 1.13 | Claude Opus 5 |
|---|---|---|
| Banking77 | 81% | 84.4% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
