AIKraft/Skills/TAO запуск сервиса инференса

TAO запуск сервиса инференса

Start, query, and stop a network-specific TAO inference microservice ({network_arch}-inference-microservice) by delegating container execution to the appropriate platform skill. Handles container image resolution, job-payload JSON construction, and the service registry. Use when the user wants to run inference on a TAO model checkpoint using a microservice container, deploy a TAO inference endpoin

nvidia official Дизайн

Что делает навык

Навык обеспечивает запуск, опрос готовности, отправку запросов на инференс и остановку микросервиса инференса TAO ({network_arch}-inference-microservice) путем делегирования запуска контейнера платформенному навыку. Он управляет реестром сервисов, формирует JSON-payload задачи и обрабатывает параметры выборки vLLM.

Когда применять

  • Запуск инференса на чекпоинте модели TAO через микросервисный контейнер.
  • Отправка запросов на инференс с явным выбором параметров (max_tokens, top_p, temperature).
  • Остановка запущенного сервиса инференса по job_id.
  • Развертывание и мониторинг доступности эндпоинта инференса TAO.

Как работает

  1. Если сессия не инициализирована плагином TAO, выполнить навык tao-setup для проверки хоста и получения учетных данных.
  2. Собрать входные данные, разрешить образ контейнера, сформировать payload задачи и команду, затем запустить контейнер через соответствующий skills/platform/<platform>/SKILL.md.
  3. Записать сервис в реестр (registry_write.<platform>) и опросить готовность (readiness_check).
  4. Для запроса инференса определить целевой сервис (по job_id, network_arch или выбору пользователя), запросить у пользователя параметры выборки (не использовать значения по умолчанию без подтверждения) и отправить тело запроса.
  5. Для остановки сервиса разрешить job_id через stop.registry_read, прочитать платформенный навык и выполнить остановку согласно разделу 5.

Примеры запросов агенту

Запусти инференс для модели TAO с чекпоинтом checkpoint_v1.
Отправь запрос на инференс, используя параметры max_tokens=100, temperature=0.7.
Останови сервис инференса с job_id abc-123.

Что понадобится

  • Инициализация сессии через навык tao-setup (если не выполнен плагином TAO skill bank).
  • Наличие и доступность навыков платформы (skills/platform/<platform>/SKILL.md).
  • Доступ к файлам шаблонов кода (references/code-templates.yaml).

Описание составлено по SKILL.md навыка, сверено 05.10.2026.

Как подключить

1Скачать навык
# возьмите папку навыка «tao-run-inference-service» из репозитория: # https://github.com/nvidia/skills
2Положить папку с SKILL.md к навыкам ассистента
# положите папку навыка туда, где ассистент ищет skills: cp -r tao-run-inference-service/ ~/.claude/skills/tao-run-inference-service/

Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.