Jetson: настройка памяти для инференса
Pick the serving stack and per-runtime memory flags (vLLM, SGLang, llama.cpp, TensorRT Edge-LLM) for an LLM/VLM workload on any NVIDIA Jetson.
AInvidia
official
Данные
Что делает навык
На основе снимка утилиты jetson-memory-audit рекомендует подходящий стек обслуживания (vLLM, SGLang, llama.cpp, TensorRT Edge-LLM) и специфичные флаги памяти для запуска LLM/VLM на конкретном SKU Jetson. Skill не выбирает рецепт квантования, но указывает минимальный уровень точности, который каждый рантайм может эффективно обслуживать.
Когда применять
- Выбор стека обслуживания для модели 7B на Orin Nano 8 GB
- Настройка параметров --gpu-memory-utilization и --max-model-len при возникновении OOM в vLLM
- Переключение с vLLM на llama.cpp при нехватке памяти для той же модели
- Анализ ситуации, когда сервер модели является основным потребителем NvMap / PSS по данным jetson-memory-audit
Как работает
- Получить снимок состояния памяти с помощью утилиты jetson-memory-audit
- Определить SKU/вариант устройства Jetson и характеристики рабочей нагрузки
- Проанализировать потребителя памяти (NvMap / PSS) и риски OOM
- Выбрать подходящий рантайм (vLLM, SGLang, llama.cpp, TensorRT Edge-LLM) с учетом доступной памяти
- Сформировать рекомендации по специфичным флагам запуска для выбранного рантайма
Примеры запросов агенту
Какой стек обслуживания использовать на Orin Nano 8 GB для запуска модели 7B?
vLLM падает с ошибкой OOM — какие значения нужно задать для --gpu-memory-utilization и --max-model-len?
При той же модели, но меньше памяти, можно ли переключиться с vLLM на llama.cpp?
Что понадобится
- Утилита jetson-memory-audit
Описание составлено по SKILL.md навыка, сверено 06.10.2026.
Как подключить
1Скачать навык
# возьмите папку навыка «jetson-inference-mem-tune» из репозитория:
# https://github.com/nvidia/skills
2Положить папку с
SKILL.md к навыкам ассистента# положите папку навыка туда, где ассистент ищет skills:
cp -r jetson-inference-mem-tune/ ~/.claude/skills/jetson-inference-mem-tune/
Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.