AIKraft/Skills/Jetson: настройка памяти для инференса

Jetson: настройка памяти для инференса

Pick the serving stack and per-runtime memory flags (vLLM, SGLang, llama.cpp, TensorRT Edge-LLM) for an LLM/VLM workload on any NVIDIA Jetson.

nvidia official Данные

Что делает навык

На основе снимка утилиты jetson-memory-audit рекомендует подходящий стек обслуживания (vLLM, SGLang, llama.cpp, TensorRT Edge-LLM) и специфичные флаги памяти для запуска LLM/VLM на конкретном SKU Jetson. Skill не выбирает рецепт квантования, но указывает минимальный уровень точности, который каждый рантайм может эффективно обслуживать.

Когда применять

  • Выбор стека обслуживания для модели 7B на Orin Nano 8 GB
  • Настройка параметров --gpu-memory-utilization и --max-model-len при возникновении OOM в vLLM
  • Переключение с vLLM на llama.cpp при нехватке памяти для той же модели
  • Анализ ситуации, когда сервер модели является основным потребителем NvMap / PSS по данным jetson-memory-audit

Как работает

  1. Получить снимок состояния памяти с помощью утилиты jetson-memory-audit
  2. Определить SKU/вариант устройства Jetson и характеристики рабочей нагрузки
  3. Проанализировать потребителя памяти (NvMap / PSS) и риски OOM
  4. Выбрать подходящий рантайм (vLLM, SGLang, llama.cpp, TensorRT Edge-LLM) с учетом доступной памяти
  5. Сформировать рекомендации по специфичным флагам запуска для выбранного рантайма

Примеры запросов агенту

Какой стек обслуживания использовать на Orin Nano 8 GB для запуска модели 7B?
vLLM падает с ошибкой OOM — какие значения нужно задать для --gpu-memory-utilization и --max-model-len?
При той же модели, но меньше памяти, можно ли переключиться с vLLM на llama.cpp?

Что понадобится

  • Утилита jetson-memory-audit

Описание составлено по SKILL.md навыка, сверено 06.10.2026.

Как подключить

1Скачать навык
# возьмите папку навыка «jetson-inference-mem-tune» из репозитория: # https://github.com/nvidia/skills
2Положить папку с SKILL.md к навыкам ассистента
# положите папку навыка туда, где ассистент ищет skills: cp -r jetson-inference-mem-tune/ ~/.claude/skills/jetson-inference-mem-tune/

Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.