Суть прорыва: эффективность против масштаба
Cisco Foundation AI представила семейство Antares — узкоспециализированные Small Language Models (SLM) для задачи локализации уязвимостей в коде. Главная интрига заключается не в достижении нового абсолютного рекорда, а в соотношении параметров и качества. Модель Antares-1B (1.6 млрд параметров) достигла показателя 0.209 File F1, превзойдя открытую модель GLM-5.2 с 753 миллиардами параметров (0.186) и даже приблизившись к GPT-5.5 (0.229).
Это доказывает, что для конкретных задач безопасности «узкие» модели могут быть эффективнее универсальных гигантов, экономя ресурсы и время развертывания.
Технические характеристики и архитектура
Модели Antares построены на базе чекпоинтов IBM Granite 4.0 и используют архитектуру decoder-only transformers. Они работают в рамках агентного цикла с доступом к терминалу Docker-песочницы. Важно отметить, что базовые модели Granite 4.0 без дообучения показывают результат около 0.000, что означает: вся полезная функциональность создана исключительно за счет пост-обучения.
| Модель | Параметры | Базовый чекпоинт | Контекст | Результат (File F1) |
|---|---|---|---|---|
| Antares-350M | 350M | Granite 4.0 350M | 32K | 0.135 |
| Antares-1B | 1.6B | Granite 4.0 1B | 128K | 0.209 |
| GLM-5.2 | 753B | — | — | 0.186 |
| GPT-5.5 | — | — | — | 0.229 |
Как работает обучение: SFT и GRPO
Ключ к успеху — двухэтапное обучение. Сначала применялось Supervised Fine-Tuning (SFT) на корпусе, состоящем на 71.5% из рассуждений по кибербезопасности. Затем использовался алгоритм GRPO (Group Relative Policy Optimization) без обученной модели вознаграждения. GRPO добавил от 11% до 25% к показателю File F1 и, что критично для продакшена, сократил дисперсию результатов на 42–65%, сделав работу модели предсказуемой.
Сравнение с традиционными инструментами
Antares не заменяет сканеры зависимостей, но превосходит их в поиске конкретных уязвимостей в коде. На бенчмарке VLoc Bench статические анализаторы показали крайне низкие результаты:
- Semgrep: 0.086 File F1
- CodeQL: 0.023 File F1
- Horusec: 0.020 File F1
Это подчеркивает способность AI-агентов адаптироваться к контексту репозитория, чего не могут rule-based сканеры.
Экономика и доступность
Все модели Antares-350M и Antares-1B доступны под лицензией Apache 2.0 на Hugging Face. Запуск полного сканирования из 500 задач на одном GPU H100 обходится менее чем в $1, тогда как аналогичный запрос к GLM-5.2 стоит $12.50, а к GPT-5.5 — $141. Модель Antares-3B в разработке, но пока не выпущена.
Бенчмарки
| Бенчмарк | Antares-1B | GLM-5.2 | GPT-5.5 |
|---|---|---|---|
| VLoc Bench (File F1) | 0.209score | 0.186score | 0.229score |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
