Исследования25 июля 2026 г., 23:17 МСК🤖 Auto

SkillSpector от NVIDIA: почему 100/100 — это не гарантия безопасности AI-агентов

NVIDIA выпустила SkillSpector для аудита навыков AI-агентов, но тесты показывают: статический анализ дает 80% ложных срабатываний, а доверие только к «зеленой галочке» опасно.

Баннер новости 4396

Проблема доверия к метрикам

Навык агента (Agent Skill) — это папка с инструкциями на plain-English, которую AI-агент загружает в контекст, когда задача совпадает с описанием. Это упрощает обмен, но создает уязвимость: любой может опубликовать вредоносный навык. NVIDIA представила SkillSpector (версия 2.3.1) как инструмент для сканирования таких пакетов. Однако тестирование показало критический разрыв между автоматическим счетом и реальной безопасностью.

На намеренно созданном honeypot-навыке SkillSpector выдал идеальные 100/100 и метку «не устанавливать». Это правильно. Но на легитимном навыке для автоматизации GitHub инструмент нашел 20 уязвимостей, 16 из которых были легитимными вызовами API, которые навык должен был выполнять. Счетчик свел все это к одному числу, не объяснив, какие 4 из 20 пунктов действительно критичны.

Почему старые сканеры не работают

Традиционные инструменты безопасности (Semgrep, Bandit, TruffleHog) не видят угрозы в текстовых инструкциях. Prompt-инъекция в файле SKILL.md — это просто английский текст, а не вредоносный код или уязвимость CVE. SkillSpector создан, чтобы читать этот текст семантически.

Сканер На что реагирует Проблема с SKILL.md
Semgrep Небезопасные паттерны кода Инъекция — это предложение на английском, а не код
Bandit Небезопасные вызовы Python Работает с .py, а не с .md
OSV-Scanner Известные CVE Новая атака не имеет CVE
TruffleHog Утечка секретов Инструкция просит прочитать секреты, но сама не является секретом

Статистика угрозы

Экосистема навыков уже скомпрометирована. Исследование, cited в самой статье SkillSpector, выявило 26.1% prompt-инъекций в 42,447 навыках. Отчет Snyk (февраль 2026) показал, что 36.8% из 3,984 проверенных навыков имели уязвимости, а 76% были подтвержденно вредоносными. Злоумышленники используют base64-кодирование для кражи AWS-ключей и прямые инструкции отключить проверки безопасности агента.

Решение: многоэтапный аудит

Автор статьи доказывает, что одного статического анализа недостаточно. Для реальной оценки безопасности требуется четыре прохода: три для обнаружения новых проблем и один для фильтрации ложных срабатываний. Пропуск этапов обнаружения позволяет самым опасным навыкам проходить проверку. Доверие к «зеленой галочке» без человеческого суждения или глубокого семантического анализа ведет к установке credential stealers.

Источник: Towards Data Science ↗