Суть инновации: от текста к вероятностям
В отличие от традиционных LLM, Jev не генерирует свободный текст. Это модель класса "non-generative", обученная с помощью RLCD (Reinforcement Learning for Calibrated Decisions). Она принимает неструктурированное состояние (JSON) и возвращает типизированные, структурированные выходы с оценкой уверенности. Это устраняет уязвимость к инструкционным атакам (jailbreak), так как у модели нет "инструкционного канала" для обхода.
Результаты тестирования: ControlArena APPS
Автор исследования (Venkat T) протестировал Jev в задаче обнаружения бэкдоров в Python-коде (ControlArena APPS). Монитор должен был отличить честный код от кода с намеренно заложенной уязвимостью, которая активируется на секретном вводе. Ключевая метрика — способность отфильтровать угрозы при фиксированном уровне ложных срабатываний (FPR), что критично для экономии бюджета аудита.
| Метрика / Параметр | Jev (TypeSafe) | o3-mini (CoT) / Базовые LLM |
|---|---|---|
| AUROC (общая точность) | 0.976 | 0.92 – 0.96 (по данным Control Tax) |
| Обнаружение бэкдоров при FPR 2% | 90% | Сопоставимо |
| Стоимость обработки | ~$0.04 за 1000 запросов | Значительно выше (зависит от модели) |
| Стабильность оценок (re-scoring) | Сдвиг 0.008 в среднем | Высокая вариативность (дрейф промптов) |
Устойчивость к атакам
Jev продемонстрировала высокую устойчивость к попыткам обмана через текст. При добавлении adversarial-комментариев в код (например, просьб к монитору быть мягче или имитации тегов одобрения), уровень подозрения к бэкдорному коду снизился не более чем на 0.014. Это подтверждает гипотезу об отсутствии уязвимости к инструкционным атакам.
Почему это важно для индустрии
Проблема доверенного мониторинга (trusted monitoring) заключается в балансе между стоимостью и надежностью. Традиционные LLM-мониторы дороги и нестабильны. Jev предлагает архитектуру, где решение принимается мгновенно и дешево, что позволяет запускать проверку на каждом запросе, а не только на подозрительных. Это меняет экономику AI Safety, делая строгий контроль рентабельным для массовых приложений.
Источник: LessWrong ↗
