Релиз модели17 сентября 2026 г., 00:01 МСК🤖 Auto

NVIDIA Jetson AGX Thor: 6.4x ускорение Agentic AI с TensorRT Edge-LLM

NVIDIA представила результаты MLPerf Inference v6.1 Edge Agentic на чипе Jetson AGX Thor. Модель Qwen3.6-27B в формате NVFP4 выполнила 1007 шагов агента за 24 минуты, что в 6.4 раза быстрее референса.

Баннер новости 7663

Рекордная скорость на edge-устройстве

Лаборатория NVIDIA опубликовала результаты бенчмарка MLPerf Inference v6.1 Edge Agentic, проведенного на одноплатном компьютере NVIDIA Jetson AGX Thor Developer Kit. Ключевое достижение — запуск модели Qwen3.6-27B в режиме SingleStream с показателем 52.33 токена/сек.

Система успешно обработала полный набор из 1 007 ходов (turns) производительной нагрузки за 24 минуты и 36 секунд. Для сравнения: референсная реализация на базе llama.cpp (квантование Q4_K_M) потребовала 2 часа 37 минут. Ускорение составило 6.4x.

Технологический стек оптимизации

Высокая производительность достигнута за счет комбинации нескольких передовых методов оптимизации, адаптированных для архитектуры Blackwell:

  • NVFP4 квантование: Веса и активации модели приведены к 4-битному формату (NVFP4), поддерживаемому GPU Thor. Кэш KV сохранен в FP8.
  • Tree-based Multi-Token Prediction (MTP): Использовано дерево из 16 узлов с 8 шагами черновика. Это дало дополнительный прирост ~40% к скорости декодирования по сравнению с линейным MTP, что критично для задач вызова функций (function-calling).
  • Reuse KV Cache: Благодаря повторному использованию кэша внимания и рекуррентного состояния, 96% токенов запроса обслуживались из «горячего» кэша. Из 13.6 млн токенов префиллинга заново вычислялось лишь ~0.5 млн.

Результаты бенчмарка

Ниже приведена сводка метик submission от NVIDIA:

Метрика Значение
Пропускная способность (Output throughput) 52.33 tokens/sec
Медианное время до первого токена (TTFT) 247.12 ms
Медианное время на один выходной токен 14.68 ms
Точность BFCL (Berkeley Function Calling Leaderboard) 87.94%
Общее время выполнения workload 24 min 36 sec

Почему это важно

Agentic AI требует длительных контекстных окон и многошагового рассуждения, что традиционно упирается в пропускную способность памяти (DRAM bandwidth) на edge-устройствах. Использование NVFP4 не только ускоряет вычисления, но и освобождает место в 128 ГБ унифицированной памяти для хранения длинных контекстов и состояний агента. Разработчики могут начать работу с ветки release/0.9.1-mlpinf библиотеки TensorRT Edge-LLM и готовым квантованным чекпоинтом Qwen3.6-27B.

Бенчмарки

БенчмаркQwen3.6-27B (TensorRT Edge-LLM)Qwen3.6-27B (llama.cpp reference)
MLPerf Inference v6.1 Edge Agentic52.33tokens8.17tokens

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: NVIDIA dev blog ↗