Суть прорыва: Open-weights для безопасности
Cantina Security совместно с Yeta Labs выпустила apex-flash-1 — специализированную модель для поиска уязвимостей (vulnerability research). Это fine-tune версия Z.ai’s GLM-5.3-Flash с 321.3 млрд параметров, обученная методом GRPO (Group Relative Policy Optimization) с использованием LoRA rank-256 и частичным обучением параметров. Модель распространяется под лицензией MIT на Hugging Face, что позволяет её свободное использование и локальный деплой.
Детали обучения и данные
Обучение проводилось на базе 50 реальных кейсов уязвимостей, которые были трансформированы в 150 задач трех типов: guided whitebox, focused whitebox и focused blackbox. 72% случаев касаются проблем авторизации, идентичности и прав доступа, 18% — ошибок в бухгалтерии и числовой точности. RL-роллы выполнялись в агентной среде Codex на продукционных окружениях.
Сравнение результатов и стоимости
Внутренний бенчмарк Cantina оценивал 60 задач из 20 новых кейсов. apex-flash-1 показал результат 66.7% (pass@1), уступив лишь Claude Opus 5 High (71.7%), но при этом обойдя базовую GLM-5.3-Flash (60.0%). Ключевое преимущество — стоимость: запуск apex-flash-1 обошелся в $2.38, тогда как Opus потребовал $74.68. Это снижает стоимость решения одной задачи с $1.74 до $0.06.
| Модель | Результат (pass@1) | Стоимость запуска | Стоимость за задачу |
|---|---|---|---|
| apex-flash-1 (Cantina) | 40/60 (66.7%) | $2.38 | $0.06 |
| GLM-5.3-Flash (Base) | 36/60 (60.0%) | $4.56 | $0.13 |
| Claude Opus 5 High | 43/60 (71.7%) | $74.68 | $1.74 |
Требования к инфраструктуре
Модель позиционируется как «рабочая лошадка» (worker), управляемая более крупными оркестраторами. Для работы в BF16 требуется около 640 ГБ GPU-памяти (мульти-GPU нода). Существуют экспериментальные варианты с измененным поведением отказов (abliterated) и квантованные версии (INT4), требующие 328 ГБ памяти, что делает её доступнее для корпоративного использования.
Почему это важно
apex-flash-1 демонстрирует, что open-source модели могут конкурировать с закрытыми лидерами в нишевой задаче безопасности при значительной экономии. Это открывает путь к созданию автономных систем пентестинга, которые можно запускать локально без риска утечки данных через API сторонних провайдеров.
Бенчмарки
| Бенчмарк | apex-flash-1 | Claude Opus 5 High | GLM-5.3-Flash |
|---|---|---|---|
| Cantina Internal Benchmark (60 tasks) | 66.7% | 71.7% | 60% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
