Jetson: развёртывание LLM
Stand up vLLM or SGLang serving on Jetson, using upstream vLLM on Thor and Orin JetPack 7.2+, and NVIDIA-AI-IOT vLLM on older Orin.
AInvidia
official
Другое
Что делает навык
Предоставляет рецепт развёртывания LLM или VLM на устройствах Jetson с использованием vLLM или SGLang, определяя подходящий контейнер в зависимости от версии JetPack и модели (Orin, Thor). Включает настройку переменных окружения, доступ к Hugging Face и запуск сервера, совместимого с OpenAI.
Когда применять
- Запуск или хостинг модели на устройстве Jetson.
- Инициализация сервера vLLM для взаимодействия через Open WebUI или собственное приложение.
- Запуск сервера после получения флагов запуска от jetson-inference-mem-tune.
- Развёртывание мультимодальных моделей (VLM) на Jetson.
Как работает
- Определить аппаратное обеспечение и версию JetPack: для Orin JetPack 7.2+ (L4T r39+) использовать upstream vLLM 0.20+, для старых Orin — контейнер NVIDIA-AI-IOT, для Thor — upstream или нативный vLLM 0.20+.
- Выбрать образ SGLang (nvcr.io/nvidia/sglang:26.01-py3) только если явно запрошен SGLang.
- Настроить переменную MAXN и обеспечить доступ к учетным данным и кэшу Hugging Face.
- Запустить сервер, совместимый с OpenAI, используя соответствующие флаги и образ контейнера.
- Выполнить проверку доступности эндпоинта (если запрошена проверка устройства).
Примеры запросов агенту
Запусти эту модель на Jetson Orin с помощью vLLM.
Нужен сервер vLLM для подключения к Open WebUI на устройстве Jetson.
Разверни VLM на Thor с использованием SGLang.
Что понадобится
- Устройство Jetson (Orin или Thor) с установленным JetPack.
- Доступ к Hugging Face (учетные данные и кэш).
- Контейнеры vLLM (vllm/vllm-openai:latest или NVIDIA-AI-IOT) или SGLang (nvcr.io/nvidia/sglang:26.01-py3).
Описание составлено по SKILL.md навыка, сверено 05.10.2026.
Как подключить
1Скачать навык
# возьмите папку навыка «jetson-llm-serve» из репозитория:
# https://github.com/nvidia/skills
2Положить папку с
SKILL.md к навыкам ассистента# положите папку навыка туда, где ассистент ищет skills:
cp -r jetson-llm-serve/ ~/.claude/skills/jetson-llm-serve/
Навык — папка с файлом SKILL.md (описание + инструкции) и опциональными скриптами. Ассистент (Claude, Claude Code и совместимые) подхватывает его по описанию и следует шагам.