Исследования7 октября 2026 г., 16:17 МСК🤖 Auto

Jev 1.13: Мониторинг за $0.042/млн токенов против GPT-5.5

TypeSafe представила Jev 1.13 — неавтоагрегативную модель без цепочки рассуждений (No-CoT), которая конкурирует с GPT-5.5 в детекции саботажа, но уступает в сложной логике.

Баннер новости 9115

Суть модели: «System One» без текста

Jev 1.13 от TypeSafe — это не классическая LLM. Она не генерирует текст токен за токеном и не использует цепочку рассуждений (Chain of Thought). Вместо этого модель принимает состояние (текст ситуации) и типизированные вопросы, отвечая на них одним шагом, выдавая вероятности для вариантов ответа. Это делает её идеальной для задач маршрутизации, классификации и мониторинга агентов, где нужен быстрый вердикт без объяснений.

Результаты на ThinkFast: «Зубчатый» профиль

В бенчмарке ThinkFast (14 тестов) Jev показала средний результат 46.8% (исправленный на шанс), что ниже GPT-5.5 (58.1%) и Opus 4.7 (53.7%). Однако её способности крайне неоднородны: она превосходит GPT-5.5 в сложных научных вопросах (GPQA-Diamond), но проигрывает в интуитивной физике и задачах на Theory of Mind (Sally-Anne).

Метрика / Задача Jev 1.13 GPT-5.5 (No-CoT) Opus 4.7 (No-CoT)
ThinkFast (среднее) 46.8% 58.1% 53.7%
GPQA-Diamond (MCQ) 65.2% 51.8% —
NCRI Ladder (ранг) 209/279 — —
Саботаж кода (AUROC) 0.99 0.99 0.99
Обнаружение сабот. (FPR 1.5%) 88.0% 90.8% —
Сэндбэггинг (AUROC) 0.94 0.91 0.97

Мониторинг агентов: Паритет с флагманами

Самое важное открытие — способность Jev выступать в роли «транскриптного монитора». При обнаружении саботажа в коде её AUROC равна 0.99, что полностью паритетно с GPT-5.5 и Opus 4.7. При строгом бюджете ложных срабатываний в 1.5% Jev выявляет 88% случаев саботажа против 90.8% у GPT-5.5. В задачах на обнаружение «сэндбэггинга» (намеренного занижения способностей) Jev также показывает результаты на уровне передовых моделей.

Стоимость и масштаб

Jev 1.13 работает в 200 раз дешевле Opus 4.7. Цена составляет $0.042 за миллион входных токенов, при этом выходные токены бесплатны. Оценка количества параметров (по аналогии с открытыми моделями в NCRI) указывает на диапазон 3–114B, хотя точная архитектура неизвестна. Для задач маршрутизации и простой валидации действий агентов Jev предлагает уникальный баланс скорости, цены и точности, не оставляя после себя «следов» рассуждений, которые можно было бы использовать для обхода.

Источник: LessWrong ↗