Инструменты19 августа 2026 г., 21:01 МСК🤖 Auto

NVIDIA SkillEvaluator: +31 балла к точности AI-агентов

NVIDIA представила open-source инструмент SkillEvaluator, который доказал: верифицированные навыки (Skills) повышают эффективность AI-агентов в среднем на 31 очко по ключевым метрикам.

Баннер новости 6097

Проблема контекста и решение NVIDIA

Даже мощные языковые модели могут терять эффективность, если агенты тратят токены на поиск нужных инструментов или совершают ошибки в специфичных задачах. NVIDIA решила эту проблему, создав пакет Verified Skills — подписанные дескрипторы возможностей, которые четко указывают агенту, когда и как использовать инструменты. Чтобы измерить реальное влияние этих навыков, разработчики выпустили NVIDIA SkillEvaluator — open-source фреймворк для бенчмаркинга.

Методология: трехуровневая оценка

Каждый навык проходит строгую проверку перед публикацией. Оценка состоит из трех этапов:

  • Уровень 1 (Безопасность и структура): Статический анализ схем, проверка на инъекции промптов, утечку данных (PII) и лицензионные риски.
  • Уровень 2 (Уникальность): Анализ эмбеддингов для выявления дублирования инструкций внутри навыка или перекрытия с другими навыками в каталоге.
  • Уровень 3 (Живые тесты): Запуск агента в изолированной среде (через фреймворк Harbor) с установленным навыком и без него. Разница в баллах называется Skill Lift.

Результаты бенчмарков: цифры важнее слов

Команда протестировала более 300 верифицированных навыков в рамках 30+ продуктов NVIDIA. Тестирование проводилось на двух популярных агентах-хернесах: Codex и Claude Code. Результаты показали значительный прирост (Skill Lift) в большинстве категорий, за исключением безопасности, где базовый уровень был и так высоким.

Ниже приведена сравнительная таблица средних баллов (из 100) для агентов без использования навыков (Baseline) и прирост (Lift) при их использовании:

Метрика Что измеряет Базовый балл (без навыка) Средний прирост (Skill Lift)
Correctness Правильность итогового ответа 46 +31 (общий)
Discoverability Умение агента найти нужный навык 42 Значительный рост
Effectiveness Достижение цели пользователя 39 Значительный рост
Efficiency Отсутствие лишних шагов и вызовов 43 Значительный рост
Security Отсутствие утечек и unsafe-операций 97 Незначительный (базовый уровень высок)

Общий средний прирост составил 31 очко. Если исключить метрику Security (так как она уже была на уровне 97/100), средний прирост возрастает до 39 очков. Это доказывает, что навыки критически важны для точности и эффективности, а не только для безопасности.

Почему это важно для разработчиков

Исследование показало, что выбор конкретного агента (Codex или Claude Code) влияет на результат меньше, чем домен продукта и дизайн оценки. Экономия токенов и времени выполнения варьируется от навыка к навыку, что требует точечной оптимизации. NVIDIA уже опубликовала плагины для Claude Code, Codex и Cursor, а сами навыки доступны через платформы Skills.sh, ClawHub и Hermes Hub. Инструмент SkillEvaluator позволяет любому разработчику проверить эффективность своих собственных навыков, используя те же стандарты, что и NVIDIA.

Источник: NVIDIA dev blog ↗