Проблема контекста и решение NVIDIA
Даже мощные языковые модели могут терять эффективность, если агенты тратят токены на поиск нужных инструментов или совершают ошибки в специфичных задачах. NVIDIA решила эту проблему, создав пакет Verified Skills — подписанные дескрипторы возможностей, которые четко указывают агенту, когда и как использовать инструменты. Чтобы измерить реальное влияние этих навыков, разработчики выпустили NVIDIA SkillEvaluator — open-source фреймворк для бенчмаркинга.
Методология: трехуровневая оценка
Каждый навык проходит строгую проверку перед публикацией. Оценка состоит из трех этапов:
- Уровень 1 (Безопасность и структура): Статический анализ схем, проверка на инъекции промптов, утечку данных (PII) и лицензионные риски.
- Уровень 2 (Уникальность): Анализ эмбеддингов для выявления дублирования инструкций внутри навыка или перекрытия с другими навыками в каталоге.
- Уровень 3 (Живые тесты): Запуск агента в изолированной среде (через фреймворк Harbor) с установленным навыком и без него. Разница в баллах называется Skill Lift.
Результаты бенчмарков: цифры важнее слов
Команда протестировала более 300 верифицированных навыков в рамках 30+ продуктов NVIDIA. Тестирование проводилось на двух популярных агентах-хернесах: Codex и Claude Code. Результаты показали значительный прирост (Skill Lift) в большинстве категорий, за исключением безопасности, где базовый уровень был и так высоким.
Ниже приведена сравнительная таблица средних баллов (из 100) для агентов без использования навыков (Baseline) и прирост (Lift) при их использовании:
| Метрика | Что измеряет | Базовый балл (без навыка) | Средний прирост (Skill Lift) |
|---|---|---|---|
| Correctness | Правильность итогового ответа | 46 | +31 (общий) |
| Discoverability | Умение агента найти нужный навык | 42 | Значительный рост |
| Effectiveness | Достижение цели пользователя | 39 | Значительный рост |
| Efficiency | Отсутствие лишних шагов и вызовов | 43 | Значительный рост |
| Security | Отсутствие утечек и unsafe-операций | 97 | Незначительный (базовый уровень высок) |
Общий средний прирост составил 31 очко. Если исключить метрику Security (так как она уже была на уровне 97/100), средний прирост возрастает до 39 очков. Это доказывает, что навыки критически важны для точности и эффективности, а не только для безопасности.
Почему это важно для разработчиков
Исследование показало, что выбор конкретного агента (Codex или Claude Code) влияет на результат меньше, чем домен продукта и дизайн оценки. Экономия токенов и времени выполнения варьируется от навыка к навыку, что требует точечной оптимизации. NVIDIA уже опубликовала плагины для Claude Code, Codex и Cursor, а сами навыки доступны через платформы Skills.sh, ClawHub и Hermes Hub. Инструмент SkillEvaluator позволяет любому разработчику проверить эффективность своих собственных навыков, используя те же стандарты, что и NVIDIA.
Источник: NVIDIA dev blog ↗
