AIKraft/Skills/TAO запуск на Kubernetes

TAO запуск на Kubernetes

Kubernetes execution platform — submits TAO container jobs as single-pod k8s Jobs with NVIDIA GPU scheduling. Use when running on EKS / GKE / AKS / on-prem clusters with the NVIDIA GPU Operator installed, or when integrating TAO into an existing k8s-native ML platform.

nvidia official Другое

Что делает навык

Skill отправляет контейнерные задачи TAO как одноподовые или распределенные Jobs в Kubernetes, обеспечивая планирование на GPU. Он интегрирует TAO в k8s-нативные ML-платформы, управляя жизненным циклом задач, проверкой ресурсов и хранением данных.

Когда применять

  • Запуск обучения или инференса TAO на EKS, GKE, AKS или локальных кластерах с NVIDIA GPU Operator.
  • Интеграция TAO в существующую Kubernetes-платформу для машинного обучения.
  • Запуск распределенного обучения на нескольких узлах (multi-node) с использованием Indexed Job.
  • Локальное тестирование и CI/CD с использованием minikube или kind.

Как работает

  1. Выполнить preflight-проверки: доступность кластера через kubectl, наличие GPU Operator и готовность runtime на узлах.
  2. Настроить параметры: указать namespace, контекст kubeconfig, уровень хранения данных (PVC или S3) и количество GPU.
  3. Открыть запись о задаче (open), сгенерировав JOB_ID и привязав директорию результатов.
  4. Рендерить манифест Job (одноподовый или Indexed для multi-node), проверить его через dry-run и применить через kubectl apply.
  5. Мониторить статус задачи (status) и просматривать логи (logs) с помощью kubectl.
  6. Отменить задачу (cancel) через kubectl delete, если это необходимо.

Примеры запросов агенту

Запусти обучение модели TAO на кластере EKS с использованием 2 GPU и сохранением данных в S3.
Проверь статус запущенной задачи TAO в Kubernetes и выведи последние 200 строк логов.
Отмени выполнение задачи TAO в namespace default и удали связанные секреты.

Что понадобится

  • Установленный kubectl и доступ к кластеру Kubernetes (kubeconfig или in-cluster service account).
  • NVIDIA GPU Operator или device plugin, установленные в кластере.
  • Для S3-данных: AWS_ACCESS_KEY_ID, AWS_SECRET_ACCESS_KEY, S3_BUCKET_NAME, S3_ENDPOINT_URL.

Описание составлено по SKILL.md навыка, сверено 05.10.2026.

Как подключить

1Скачать навык
# возьмите папку навыка «tao-run-on-kubernetes» из репозитория: # https://github.com/nvidia/skills
2Положить папку с SKILL.md к навыкам ассистента
# положите папку навыка туда, где ассистент ищет skills: cp -r tao-run-on-kubernetes/ ~/.claude/skills/tao-run-on-kubernetes/

Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.