AIKraft/Skills/Масштабирование рабочих нагрузок GKE

Масштабирование рабочих нагрузок GKE

Manages scaling for GKE workloads using HPA and VPA. Use when configuring Horizontal Pod Autoscaler (HPA), configuring Vertical Pod Autoscaler (VPA), or applying best practices for GKE workload autoscaling. Do not use for cluster-level autoscaling (Cluster Autoscaler), static cluster sizing, or configuring node-level machine styles directly.

GOGoogle official Другое

Что делает навык

Навык управляет масштабированием рабочих нагрузок в Google Kubernetes Engine (GKE) с помощью ручного изменения количества реплик, Horizontal Pod Autoscaler (HPA) и Vertical Pod Autoscaler (VPA). Он решает задачи автоматического и ручного изменения количества подов и их ресурсов (CPU, память) для оптимизации производительности и стоимости. Навык не применяется для автомасштабирования на уровне кластера (Cluster Autoscaler) или настройки типов машин узлов.

Когда применять

  • Ручное масштабирование развертывания до фиксированного числа реплик для тестирования или немедленного вмешательства.
  • Автоматическое масштабирование количества подов на основе использования CPU, памяти или внешних метрик (например, длины очереди Pub/Sub) с помощью HPA.
  • Автоматическая корректировка запрашиваемых ресурсов CPU и памяти для подов в соответствии с фактическим использованием через VPA.
  • Практика «правого размера» (rightsizing): анализ рекомендаций VPA в режиме Off и применение оптимизированных запросов ресурсов с буфером.
  • Настройка режимов работы VPA (Initial, Auto, InPlaceOrRecreate) для обновления ресурсов работающих подов.

Как работает

  1. Для ручного масштабирования выполнить команду kubectl scale deployment {deployment_name} --replicas={number} -n {namespace} и проверить событие масштабирования через kubectl get deployment.
  2. Для HPA убедиться, что запущен Metrics Server и определены запросы/лимиты ресурсов; создать HPA через команду kubectl autoscale или применив манифест из assets/hpa-example.yaml.
  3. Для масштабирования по внешним метрикам использовать тип External metric, поддерживаемый GKE нативно, или интегрировать Prometheus Adapter для метрик Prometheus.
  4. Для VPA убедиться, что он включен на кластере (в Autopilot включен по умолчанию, в Standard требуется gcloud container clusters update --enable-vertical-pod-autoscaling).
  5. Настроить VPA, выбрав режим работы: Off (только рекомендации), Initial (ресурсы при создании), Auto (перезапуск подов) или InPlaceOrRecreate (обновление без перезапуска, GKE 1.34+).
  6. При практике правого размера развернуть VPA в режиме Off на 24+ часа, прочитать рекомендации через kubectl describe vpa, сравнить с текущими запросами и применить новые значения с буфером 20%.

Примеры запросов агенту

Масштабируй деплоймент my-app в неймспейке production до 5 реплик.
Настрой HPA для деплоймента api-server, чтобы количество подов менялось от 2 до 10 при использовании CPU 50%.
Включи Vertical Pod Autoscaler для кластера my-cluster в зоне us-central1-a и настрой режим Auto для деплоймента worker.

Что понадобится

  • Клиент kubectl, настроенный для доступа к кластеру GKE.
  • Утилита gcloud для управления настройками кластера (включение VPA).
  • Metrics Server (включен по умолчанию в GKE) и правильно определенные resource requests/limits в контейнерах.

Описание составлено по SKILL.md навыка, сверено 06.10.2026.

Как подключить

1Скачать навык
# возьмите папку навыка «gke-workload-scaling» из репозитория: # https://github.com/google/skills
2Положить папку с SKILL.md к навыкам ассистента
# положите папку навыка туда, где ассистент ищет skills: cp -r gke-workload-scaling/ ~/.claude/skills/gke-workload-scaling/

Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.