Архитектура и спецификации
MAI-Cyber-1-Flash — это первая модель Microsoft, созданная исключительно для киберзащиты. Это трансформер с механизмом self-attention и разреженным Mixture-of-Experts (MoE). Модель имеет 137 млрд общих параметров, но в работе задействует только 5 млрд активных, что обеспечивает высокую эффективность. Длина контекста составляет 256k токенов. Модель является специализированным дообучением легковесной агентной модели MAI-Code-1-Flash (используемой в GitHub Copilot) и происходит от линейки MAI-Thinking-1. Важно отметить: модель работает только с текстовыми входами и выходами.
Результаты на CyberGym и сравнение с конкурентами
Ключевой метрикой стала оценка на публичном наборе данных CyberGym, который включает 1 507 задач по воспроизведению уязвимостей из 188 проектов OSS-Fuzz. Система MDASH, использующая MAI-Cyber-1-Flash в связке с GPT-5.4, показала результат 95.95%. Это примерно на 12 процентных пунктов выше, чем у модели Anthropic Mythos, и значительно превосходит другие системы на лидерборде (83.2%–85.6%). Для сравнения, в мае 2026 года тот же оркестратор на базовых моделях показывал 88.45%.
| Бенчмарк / Метрика | Результат MAI-Cyber-1-Flash | Примечание |
|---|---|---|
| CyberGym (в составе MDASH) | 95.95% | Системный результат (модель + GPT-5.4) |
| CVEBench | 0.314 | Самостоятельный тест модели |
| CyberSecEval4 — Threat Intel | 0.553 | Анализ угроз |
| CyberSecEval4 — Malware Analysis | 0.33 | Анализ вредоносного ПО |
| CRSBench | 0.651 | При POV=1200 |
| ExploitGym (Kernel/Userspace/Browser) | 0 / 0 / 0 | Намеренный результат: модель не пишет эксплойты |
Экономика и роутинг: почему это важно
Главный продукт здесь — не сама модель, а система маршрутизации в оркестраторе MDASH. MAI-Cyber-1-Flash обрабатывает до 90% задач благодаря своей эффективности, оставляя самые сложные 10% для мощной, но дорогой GPT-5.4. Такой подход позволяет сократить затраты на 50% по сравнению с предыдущей конфигурацией, где использовались GPT-5.4, 5.4 mini и 5.3 codex. MDASH управляет более чем 100 специализированными агентами на пяти этапах: Prepare, Scan, Validate, Dedupe и Prove.
Безопасность и практическая польза
Результаты 0/0/0 на ExploitGym — это не баг, а фича. Модель обучена на оборонительных задачах (поиск и патчинг уязвимостей), а не на создании эксплойтов. Команда Autonomous Code Security (ACS), в которую вошли победители DARPA AI Cyber Challenge, уже применила MDASH для обнаружения реальных угроз: в мае было сгенерировано 16 CVE, включая четыре критические уязвимости удаленного выполнения кода в стеке Windows. Кроме того, система успешно восстановила 96% случаев в clfs.sys и 100% в tcpip.sys за пятилетний период.
Источник: MarkTechPost ↗
