В эпоху стремительного развития агентного искусственного интеллекта (Agentic AI) возникает фундаментальный вопрос: как измерить реальную ценность добавленных в систему инструментов? Даже самые мощные языковые модели могут теряться в лабиринтах собственных решений, тратить токены на бессмысленные действия или выбирать неверные инструменты из-за недостатка контекста. NVIDIA предлагает решение этой проблемы через концепцию Verified Skills (верифицированных навыков) и инструмент SkillEvaluator. Это не просто набор инструкций, а строгая система оценки, которая превращает хаотичные попытки агента в предсказуемый, измеримый и оптимизированный процесс.
В этой статье мы подробно разберем результаты первого крупного бенчмарка NVIDIA, в котором оценивалось более 300 верифицированных навыков для 30+ продуктов. Мы покажем, как трехуровневая система оценки выявляет скрытые проблемы, почему контекст важнее самого модели и как внедрение навыков может заметно улучшить показатели агентов. Это руководство для разработчиков, которые хотят перейти от экспериментов к промышленному использованию AI-агентов.

01Проблема «потери контекста» в Agentic AI
AI-агенты эффективны ровно настолько, насколько хорош контекст, который они получают. Даже при наличии мощных моделей и хорошо документированных библиотек, таких как NVIDIA libraries, агенты часто сталкиваются с серьезными препятствиями. Они могут тратить лишние шаги на поиск нужного инструмента, сжигать токены на тупиковых вариантах или просто не справляться со специализированными задачами из-за отсутствия четких инструкций.
Здесь на сцену выходят Skill (навыки). В экосистеме NVIDIA Skill — это не просто код, а упакованный, подписанный дескриптор возможности. Он содержит четкие инструкции, примеры использования и руководство по вызову инструментов. Главная цель навыка — сократить путь агента от намерения пользователя (intent) к решению (solution). Однако, чтобы убедиться, что навык действительно работает, а не просто добавляет шум, необходима строгая оценка.
Именно для этого NVIDIA разработала SkillEvaluator — инструмент с открытым исходным кодом, который измеряет влияние верифицированных навыков на производительность агентов. Он позволяет проводить сравнительный анализ: запускать агента с установленным навыком и без него, изолируя переменную и измеряя чистый прирост эффективности.

02Методология: Трехуровневая система оценки
Прежде чем навык будет опубликован в каталоге, он проходит через три строгих уровня проверки. Каждый уровень отвечает на свой вопрос и может быть запущен независимо. Эта система обеспечивает безопасность, релевантность и практическую полезность навыка.
Уровень 1: Безопасность и структура (Static Checks)
На этом этапе проводится статический анализ кода и метаданных. Проверяются схемы (schema) и frontmatter на соответствие стандартам. Критически важным является сканирование на безопасность: поиск уязвимостей к инъекциям промптов (prompt injection) и утечке данных (data exfiltration). Также выявляются секреты, персональные данные (PII), проверяются лицензии и проводится линтинг скриптов. Этот уровень гарантирует, что навык не несет угроз для инфраструктуры пользователя.
Уровень 2: Уникальность (Distinctiveness)
Используя анализ эмбеддингов (embedding similarity), система выявляет дублирующиеся инструкции внутри одного навыка и пересекающееся покрытие в рамках всего каталога. Это предотвращает «шум» в контексте агента. Если два навыка предлагают одинаковые решения, агент может запутаться. Уровень 2 гарантирует, что каждый навык вносит уникальный вклад в базу знаний агента.
Уровень 3: Живая оценка (Live Evaluation)
Это самый важный этап. Он использует фреймворк Harbor — открытую среду для запуска агентов в изолированных, воспроизводимых условиях. SkillEvaluator преобразует тестовые кейсы в задачи, запускает агентов в песочницах (sandboxes) и собирает результаты. Для каждого кейса агент запускается дважды: один раз с установленным навыком, второй раз без него. Разница в баллах между этими двумя запусками и есть метрика Skill Lift (подъем навыка).
03Как работает живая оценка: Практический пример
Процесс оценки интуитивно понятен и интегрируется в рабочий процесс разработчика. Давайте рассмотрим пошаговый пример того, как создать датасет для оценки и запустить сравнительный тест.
Сначала генерируется датасет для конкретного навыка. Команда skillevaluator create-eval-dataset ./my-skill --full создает файл evals/evals.json. Флаг --full критически важен: он включает в датасет не только явные (explicit) и неявные (implicit) случаи, но и контекстуальные (contextual) и негативные (negative) кейсы. Это позволяет проверить, как агент ведет себя в сложных или нестандартных ситуациях.
После проверки случаев запускается живая оценка:
skillevaluator tier3 evaluate ./my-skill \
--agents codex \
--env-mode dockerЭта команда преобразует кейсы в пакет задач Harbor, запускает каждый кейс с навыком и без него, оценивает оба запуска и выдает итоговые баллы и Skill Lift. Harbor берет на себя управление выполнением и изоляцией, позволяя разработчику сосредоточиться на качестве самого навыка.

04Результаты бенчмарка: Цифры говорят сами за себя
В августе 2026 года NVIDIA опубликовала первые результаты масштабного бенчмарка, охватывающего более 300 верифицированных навыков для
Источник: NVIDIA Developer ↗
