Суть эксперимента: Jev против флагманов
Исследователь mahi-pas протестировал новую модель Jev на задаче мониторинга цепочек рассуждений (Chain-of-Thought, CoT). В отличие от традиционных языковых моделей, Jev не генерирует текст, а выводит вероятности (certainties) для заданного набора опций. Это архитектурное решение делает её экстремально быстрой. Для сравнения производительности использовались Claude Sonnet 5 и GPT-5.6 Luna на датасете ReasoningShield (2 200 примеров мыслительных процессов с метками вреда).
Результаты: Скорость и цена
Главное преимущество Jev — экономическая эффективность и задержка. Модель обрабатывает запросы в среднем за 542 мс, что делает её в 6 раз быстрее Sonnet 5 и в 3,7 раза быстрее Luna. Стоимость классификации 1 000 запросов составляет всего $0.056, что в 566 раз дешевле Sonnet 5 и в 41 раз дешевле GPT-5.6 Luna.
| Классификатор | Точность (Exact Match) | Macro F1 | Среднее время (мс) | Цена за 1 000 (USD) |
|---|---|---|---|---|
| Jev | 71.5% | 58.2% | 542 | $0.056 |
| Claude Sonnet 5 | 71.4% | 56.4% | 3,348 | $3.17 |
| GPT-5.6 Luna | 79.4% | 70.3% | 2,007 | $0.23 |
Точность: Где Jev проигрывает
Несмотря на лидерство в скорости, Jev уступает в качестве обнаружения реальных угроз. GPT-5.6 Luna демонстрирует значительно более высокую точность (79.4% против 71.5% у Jev) и лучший показатель Macro F1 (70.3% против 58.2%).
Критический недостаток Jev заключается в способности выявлять опасный контент. Модель хуже конкурентов справляется с классификацией вредных (Harmful) мыслительных процессов. В категориях, требующих высокой чувствительности к рискам, таких как детская эксплуатация, кибербезопасность, ненависть, запрещенные товары, секс и насилие, Jev проигрывает как Sonnet 5, так и Luna. Jev выигрывает у Sonnet 5 только в категориях обмана, экономических рисков, политических рисков и нарушений прав, но всё равно уступает Luna.
Вывод: Эволюция или тупик?
Jev демонстрирует огромный потенциал как дешевый и быстрый фильтр для «очевидных» случаев вреда, что может быть критично для масштабирования безопасных систем. Однако автор выражает сомнения в долгосрочной эффективности мониторинга CoT, учитывая, что такие модели, как GPT-6, становятся лучше в обходе таких систем. Jev может стать отличным первым слоем защиты, но для выявления сложных манипуляций пока требуются более точные, albeit дорогие, модели.
Бенчмарки
| Бенчмарк | Jev | Claude Sonnet 5 | GPT-5.6 Luna |
|---|---|---|---|
| ReasoningShield Exact-match Accuracy | 71.5% | 71.4% | 79.4% |
| ReasoningShield Macro F1 | 58.2% | 56.4% | 70.3% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: LessWrong ↗
