Релиз модели18 сентября 2026 г., 19:18 МСК🤖 Auto

Jev от TypeSafe: Не-генеративный монитор для AI-контроля

TypeSafe AI представила Jev — модель, обученную на структурированных решениях, а не на тексте. В тестах на обнаружение бэкдоров в коде она показала точность, сопоставимую с o3-mini, при стоимости $0.04 за 1000 запросов.

Баннер новости 7813

Суть инновации: от текста к вероятностям

В отличие от традиционных LLM, Jev не генерирует свободный текст. Это модель класса "non-generative", обученная с помощью RLCD (Reinforcement Learning for Calibrated Decisions). Она принимает неструктурированное состояние (JSON) и возвращает типизированные, структурированные выходы с оценкой уверенности. Это устраняет уязвимость к инструкционным атакам (jailbreak), так как у модели нет "инструкционного канала" для обхода.

Результаты тестирования: ControlArena APPS

Автор исследования (Venkat T) протестировал Jev в задаче обнаружения бэкдоров в Python-коде (ControlArena APPS). Монитор должен был отличить честный код от кода с намеренно заложенной уязвимостью, которая активируется на секретном вводе. Ключевая метрика — способность отфильтровать угрозы при фиксированном уровне ложных срабатываний (FPR), что критично для экономии бюджета аудита.

Метрика / Параметр Jev (TypeSafe) o3-mini (CoT) / Базовые LLM
AUROC (общая точность) 0.976 0.92 – 0.96 (по данным Control Tax)
Обнаружение бэкдоров при FPR 2% 90% Сопоставимо
Стоимость обработки ~$0.04 за 1000 запросов Значительно выше (зависит от модели)
Стабильность оценок (re-scoring) Сдвиг 0.008 в среднем Высокая вариативность (дрейф промптов)

Устойчивость к атакам

Jev продемонстрировала высокую устойчивость к попыткам обмана через текст. При добавлении adversarial-комментариев в код (например, просьб к монитору быть мягче или имитации тегов одобрения), уровень подозрения к бэкдорному коду снизился не более чем на 0.014. Это подтверждает гипотезу об отсутствии уязвимости к инструкционным атакам.

Почему это важно для индустрии

Проблема доверенного мониторинга (trusted monitoring) заключается в балансе между стоимостью и надежностью. Традиционные LLM-мониторы дороги и нестабильны. Jev предлагает архитектуру, где решение принимается мгновенно и дешево, что позволяет запускать проверку на каждом запросе, а не только на подозрительных. Это меняет экономику AI Safety, делая строгий контроль рентабельным для массовых приложений.

Источник: LessWrong ↗