Суть модели: «System One» без текста
Jev 1.13 от TypeSafe — это не классическая LLM. Она не генерирует текст токен за токеном и не использует цепочку рассуждений (Chain of Thought). Вместо этого модель принимает состояние (текст ситуации) и типизированные вопросы, отвечая на них одним шагом, выдавая вероятности для вариантов ответа. Это делает её идеальной для задач маршрутизации, классификации и мониторинга агентов, где нужен быстрый вердикт без объяснений.
Результаты на ThinkFast: «Зубчатый» профиль
В бенчмарке ThinkFast (14 тестов) Jev показала средний результат 46.8% (исправленный на шанс), что ниже GPT-5.5 (58.1%) и Opus 4.7 (53.7%). Однако её способности крайне неоднородны: она превосходит GPT-5.5 в сложных научных вопросах (GPQA-Diamond), но проигрывает в интуитивной физике и задачах на Theory of Mind (Sally-Anne).
| Метрика / Задача | Jev 1.13 | GPT-5.5 (No-CoT) | Opus 4.7 (No-CoT) |
|---|---|---|---|
| ThinkFast (среднее) | 46.8% | 58.1% | 53.7% |
| GPQA-Diamond (MCQ) | 65.2% | 51.8% | — |
| NCRI Ladder (ранг) | 209/279 | — | — |
| Саботаж кода (AUROC) | 0.99 | 0.99 | 0.99 |
| Обнаружение сабот. (FPR 1.5%) | 88.0% | 90.8% | — |
| Сэндбэггинг (AUROC) | 0.94 | 0.91 | 0.97 |
Мониторинг агентов: Паритет с флагманами
Самое важное открытие — способность Jev выступать в роли «транскриптного монитора». При обнаружении саботажа в коде её AUROC равна 0.99, что полностью паритетно с GPT-5.5 и Opus 4.7. При строгом бюджете ложных срабатываний в 1.5% Jev выявляет 88% случаев саботажа против 90.8% у GPT-5.5. В задачах на обнаружение «сэндбэггинга» (намеренного занижения способностей) Jev также показывает результаты на уровне передовых моделей.
Стоимость и масштаб
Jev 1.13 работает в 200 раз дешевле Opus 4.7. Цена составляет $0.042 за миллион входных токенов, при этом выходные токены бесплатны. Оценка количества параметров (по аналогии с открытыми моделями в NCRI) указывает на диапазон 3–114B, хотя точная архитектура неизвестна. Для задач маршрутизации и простой валидации действий агентов Jev предлагает уникальный баланс скорости, цены и точности, не оставляя после себя «следов» рассуждений, которые можно было бы использовать для обхода.
Источник: LessWrong ↗
