В мире искусственного интеллекта, где гонка за «фронтальными» моделями (frontier models) кажется бесконечной, компания Sakana AI предлагает иной взгляд на развитие технологий. 21 июля 2026 года они представили Fugu-Cyber (идентификатор модели: fugu-cyber-v1.0). Но важно сразу прояснить ключевой момент: это не просто новая большая языковая модель, обученная с нуля. Это специализированная конечная точка (endpoint) в рамках их экосистемы оркестрации Fugu, тонко настроенная для задач логического вывода в сфере кибербезопасности.
Запуск этой модели стал логичным продолжением стратегии Sakana AI, которая месяц назад представила базовый оркестратор Fugu. Идея заключается в том, что вместо создания одной универсальной «супер-модели», система учится координировать работу специализированных агентов. Fugu-Cyber — это третий такой «эндпоинт», созданный специально для рассуждений в области безопасности. В этой статье мы подробно разберем, как работает эта архитектура, что на самом деле означают заявленные результаты тестов, и какие практические последствия это имеет для специалистов по кибербезопасности, включая доступ из России.
01Что такое Fugu-Cyber и почему это не просто еще одна LLM?
Чтобы понять ценность Fugu-Cyber, нужно разобраться в архитектуре, которую Sakana AI называет «оркестрацией». В отличие от традиционных подходов, где одна большая модель (LLM) пытается решить всю задачу самостоятельно, Fugu работает как дирижер. Сама по себе Fugu — это языковая модель, но её главная задача — читать запрос пользователя и динамически строить «агентный скелет» (agentic scaffold). Она разбивает сложную задачу на подзадачи и делегирует их специализированным моделям из пула.
Этот подход документирован в техническом отчете Sakana AI и двух статьях, опубликованных на конференции ICLR 2026: TRINITY и The Conductor. Архитектура TRINITY распределяет роли между несколькими LLM: «Мыслитель» (Thinker), «Рабочий» (Worker) и «Проверющий» (Verifier). Модель The Conductor обучается стратегиям координации на естественном языке с помощью усиленного обучения (reinforcement learning).
В контексте кибербезопасности Sakana AI делает особый акцент на роли Verifier (Проверющего). Когда один агент находит потенциальную уязвимость, она не сразу используется для создания патча или атаки. Вместо этого кандидаты передаются на проверку специализированным суб-агентам, обладающим глубокими знаниями в области безопасности. Только после успешной валидации предложение о патче или эксплойте считается готовым. Маршрутизация запросов между этими моделями остается проприетарной, поэтому пользователь не видит, какая именно модель обрабатывала каждый конкретный шаг, но это обеспечивает высокий уровень контроля качества.
02Разбор бенчмарков: CyberGym и CTI-REALM
Sakana AI сообщает о впечатляющих результатах: 86,9% успеха на CyberGym и 72,1% на CTI-REALM. Компания заявляет, что эти показатели сопоставимы с результатами кибер-ориентированных фронтальных моделей, таких как GPT-5.5-Cyber и Claude Mythos Preview. Однако, чтобы оценить истинную значимость этих цифр, необходимо понять, что именно измеряют эти тесты. Они находятся на противоположных концах рабочего процесса кибербезопасности.

CyberGym: Поиск и доказательство уязвимостей
CyberGym — это бенчмарк от Университета Калифорнии в Беркли, основанный на 1507 реальных уязвимостях, обнаруженных в 188 проектах OSS-Fuzz. Задача здесь сформулирована очень жестко: агент получает описание уязвимости и незакрытый (unpatched) код. Его цель — написать proof-of-concept (PoC), который вызывает сбой в сборке до исправления, но НЕ вызывает сбой в сборке после исправления.
Именно этот шаг верификации делает бенчмарк сложным для «обмана». Многие модели могут просто угадать код, который ломает систему, но лишь немногие способны создать точный эксплоит, который перестает работать после применения патча. Это требует глубокого понимания того, как именно работает исправление. Результат в 86,9% показывает, что Fugu-Cyber умеет не просто генерировать код, а понимать логику исправления ошибок.
CTI-REALM: От разведки угроз к обнаружению
CTI-REALM — это открытый бенчмарк от Microsoft для обучения созданию систем обнаружения. Microsoft курировала 37 публичных отчетов об угрозах из таких источников, как Datadog Security Labs, Palo Alto Networks и Splunk. Задача агента здесь иная: он должен сопоставить техники MITRE ATT&CK, исследовать телеметрию, итеративно писать запросы KQL (Kusto Query Language) и выдавать валидированные правила Sigma.
Оценка охватывает Linux-конечные точки, Azure Kubernetes Service (AKS) и облако Azure. Здесь Fugu-Cyber показал результат 72,1%. Важно отметить, что CTI-REALM оценивается как «вознаграждение за траекторию» (trajectory reward) в диапазоне от 0 до 1, а не как простой показатель «сдал/не сдал». Sakana AI называет это «процентом успеха», что является упрощением, но суть остается ясной: модель эффективно превращает разведывательные данные в работающие правила обнаружения.
03Где 86,9% находится в контексте рынка?
Цифры сами по себе могут вводить в заблуждение без сравнения с конкурентами. Когда исследователи CyberGym опубликовали свои первые результаты, лучший результат связки «агент-модель» составлял около 20%. Это был отправной point. В апреле 2026 года Anthropic сообщила о результате 83,1% для Claude Mythos Preview в рамках проекта Glasswing. OpenAI позже представила обновленную GPT-5.5-Cyber, показавшую 85,6% (по сравнению с 81,8% для базовой GPT-5.5).

Таким образом, результат Sakana AI в 86,9% является небольшим шагом вперед по сравнению с сообщенными фронтальными результатами, а не скачком. Это говорит о том, что оркестрационный подход Sakana AI позволяет достичь производительности, сопоставимой с лучшими специализированными моделями от гигантов индустрии, используя, вероятно, более гибкую и модульную архитектуру.
Ситуация с CTI-REALM выглядит иначе. Оценка Microsoft показала, что топ-три конфигурации (все на базе Claude) находились в диапазоне от 0,624 до 0,685. Результат Fugu-Cyber в 72,1% (или 0,721) помещает его выше этого диапазона. Однако, как упоминалось выше, из-за различий в метриках оценки прямое сравнение требует осторожности. Тем не менее, это подтверждает высокую эффективность Fugu-Cyber в задачах создания правил обнаружения.
04Доступ, политика и ценообразование
Несмотря на технологические достижения, доступ к Fugu-Cyber строго регулируется. Sakana AI установила четыре основных барьера для использования модели:
- Заявка и ручная проверка. Доступ требует заполнения формы заявки, где необходимо указать предполагаемый сценарий использования и предоставить проверенные контактные данные. Каждая заявка рассматривается вручную командой Sakana.
- Политика приемлемого использования (AUP). Модель выпущена под обновленной политикой, которая строго запрещает использование в offensivemиссиях (например, для создания вредоносного ПО или атак). Разрешено только оборонительное использование.
- Только Token Plan. Биллинг ограничен планом токенов. Подписки на $20, $100 и $200 покрывают только базовые модели Fugu и Fugu-Ultra. Для Fugu-Cyber требуется отдельная оплата по токену.
- Географические ограничения. Fugu API не предлагается в Европейском Союзе (EU) и Европейской экономической зоне (EEA), так как Sakana работает над соответствием требованиям GDPR. Это важный момент для европейских компаний.
Ценообразование и скрытые расходы
Стоимость использования Fugu-Cyber фиксирована, но имеет нюансы, связанные с длиной контекста:

- Входные токены: $6 за миллион токенов.
- Выходные токены: $36 за миллион токенов.
- Кэшированные входные токены: $0,60 за миллион токенов.
Все три ставки удваиваются, если контекст превышает 272 000 токенов. Каждая линия цены составляет ровно 1,2x от ставки Fugu-Ultra, что представляет собой фиксированную надбавку в 20% за специализированный кибер-эндпоинт. Однако, поскольку длинные кодовые базы легко превышают порог в 272K токенов, удвоенный тариф — это не редкий случай, а скорее правило для серьезных проектов. Это необходимо учитывать при расчете бюджета.
05Как работает оркестрация на практике?
Процесс работы Fugu-Cyber можно описать как цикл «мысль-действие-проверка». Когда пользователь задает вопрос, например, «найди уязвимость в этом фрагменте кода», Fugu не просто выдает ответ. Она создает план действий. Один агент (Thinker) анализирует запрос и определяет, какие инструменты нужны. Другой (Worker) выполняет код или ищет информацию. Третий (Verifier) проверяет результат на соответствие критериям безопасности.
Этот подход особенно полезен в кибербезопасности, где ложноположительные результаты могут стоить дорого. Верификатор выступает в роли «красного комитета», который должен одобрить вывод перед тем, как он будет представлен пользователю. Это снижает риск галлюцинаций модели, которые являются серьезной проблемой для LLM в критически важных задачах.
06Что это значит на практике
Релиз Fugu-Cyber знаменует собой сдвиг от парадигмы «одна модель для всего» к парадигме «агентная оркестрация для специализированных задач». Для специалистов по кибербезопасности это означает несколько важных вещей:
- Повышение точности анализа. Использование специализированных верификаторов позволяет снизить количество ошибок и ложных срабатываний при анализе уязвимостей и создании правил обнаружения.
- Гибкость и масштабируемость. Оркестратор позволяет легко заменять или обновлять отдельные модели в пуле без переобучения всей системы. Если появится новая, более точная модель для анализа KQL, её можно интегрировать в Fugu-Cyber без изменения всей архитектуры.
- Фокус на оборонительных задачах. Строгая политика использования и ручная проверка заявок означают, что Sakana AI позиционирует Fugu-CyB как инструмент для профессионалов, а не для хакеров. Это создает более безопасную экосистему, но ограничивает доступ для энтузиастов.
- Экономическая эффективность для крупных проектов. Несмотря на удвоенную ставку для длинных контекстов, оркестрационный подход может быть более экономичным в долгосрочной перспективе, так как позволяет использовать более дешевые модели для простых задач и дорогие — только для сложных, требующих верификации.
Sakana AI утверждает, что комбинация мощного API и человеческого экспертного знания превосходит использование только API. Fugu-Cyber — это шаг в сторону реализации этой философии, предлагая не просто генерацию текста, а структурированный, проверенный процесс рассуждения. Для компаний, готовых инвестировать в передовые технологии кибербезопасности, это может стать значимым конкурентным преимуществом, особенно в условиях растущей сложности киберугроз.
Источник: MarkTechPost ↗
