AIKraft/Skills/physical ai настройка инфраструктуры и отказоустойчивое масштабирование

physical ai настройка инфраструктуры и отказоустойчивое масштабирование

Use when the user wants to set up, scale, validate, or harden NVIDIA physical AI infrastructure for synthetic data generation workflows across local MicroK8s or Azure AKS, including Kubernetes clusters, inference endpoint deployment, OSMO deployment, workload submission readiness, and infrastructure failure recovery. Trigger keywords: physical ai infrastructure, resilient scaling, SDG infrastructu

nvidia official Данные

Что делает навык

Настройка, масштабирование и проверка инфраструктуры NVIDIA Physical AI для генерации синтетических данных (SDG) в локальных кластерах MicroK8s или Azure AKS. Skill обеспечивает воспроизводимое развертывание кластера, сервисов вывода (inference) и OSMO, а также гарантирует отказоустойчивость и восстановление после сбоев.

Когда применять

  • Развертывание инфраструктуры Physical AI на локальном MicroK8s с использованием NIM Operator или NVCF.
  • Настройка отказоустойчивого кластера Azure AKS с интеграцией Azure AI Foundry и Azure OSMO.
  • Проверка готовности инфраструктуры (preflight) и восстановление после сбоев на этапе развертывания или выполнения рабочих процессов.
  • Маршрутизация рабочих нагрузок, таких как Video Data Augmentation или Defect Image Generation, через OSMO.

Как работает

  1. Выбрать целевую инфраструктуру (MicroK8s или Azure AKS), компонент вывода (NIM Operator, NVCF, Azure AI Foundry или None) и рабочую нагрузку.
  2. Загрузить только необходимые справочные материалы компонентов и разрешить зависимости (API-ключи, квоты, доступ Azure).
  3. Запустить скрипт scripts/preflight.sh для проверки состояния кластера, хранилищ и конфигураций до начала развертывания.
  4. Развернуть кластер Kubernetes, затем параллельно развернуть OSMO и сервисы вывода, пройдя обязательные проверки (gates).
  5. Отправить рабочую нагрузку через OSMO CLI после проверки предварительных условий и доступности эндпоинтов.
  6. Мониторить выполнение рабочих процессов, используя логи и события OSMO для диагностики сбоев вместо слепого повторного запуска.

Примеры запросов агенту

Настройте отказоустойчивую инфраструктуру Physical AI для VDA на Azure AKS с использованием NIM Operator.
Разверните кластер MicroK8s и OSMO для локальной генерации синтетических данных с проверкой готовности.
Проверьте и восстановите инфраструктуру Physical AI после сбоя кластера Kubernetes.

Что понадобится

  • Доступ к репозиторию с компонентами (components/) и скриптами (scripts/).
  • Ключи API и учетные данные Azure, хранящиеся в ${REPO_ROOT}/.env.
  • Квоты на GPU/CPU и доступ к CIDR caller для Azure AKS.

Описание составлено по SKILL.md навыка, сверено 06.10.2026.

Как подключить

1Скачать навык
# возьмите папку навыка «physical-ai-infrastructure-setup-and-resilient-scaling» из репозитория: # https://github.com/nvidia/skills
2Положить папку с SKILL.md к навыкам ассистента
# положите папку навыка туда, где ассистент ищет skills: cp -r physical-ai-infrastructure-setup-and-resilient-scaling/ ~/.claude/skills/physical-ai-infrastructure-setup-and-resilient-scaling/

Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.