Рекордная скорость на edge-устройстве
Лаборатория NVIDIA опубликовала результаты бенчмарка MLPerf Inference v6.1 Edge Agentic, проведенного на одноплатном компьютере NVIDIA Jetson AGX Thor Developer Kit. Ключевое достижение — запуск модели Qwen3.6-27B в режиме SingleStream с показателем 52.33 токена/сек.
Система успешно обработала полный набор из 1 007 ходов (turns) производительной нагрузки за 24 минуты и 36 секунд. Для сравнения: референсная реализация на базе llama.cpp (квантование Q4_K_M) потребовала 2 часа 37 минут. Ускорение составило 6.4x.
Технологический стек оптимизации
Высокая производительность достигнута за счет комбинации нескольких передовых методов оптимизации, адаптированных для архитектуры Blackwell:
- NVFP4 квантование: Веса и активации модели приведены к 4-битному формату (NVFP4), поддерживаемому GPU Thor. Кэш KV сохранен в FP8.
- Tree-based Multi-Token Prediction (MTP): Использовано дерево из 16 узлов с 8 шагами черновика. Это дало дополнительный прирост ~40% к скорости декодирования по сравнению с линейным MTP, что критично для задач вызова функций (function-calling).
- Reuse KV Cache: Благодаря повторному использованию кэша внимания и рекуррентного состояния, 96% токенов запроса обслуживались из «горячего» кэша. Из 13.6 млн токенов префиллинга заново вычислялось лишь ~0.5 млн.
Результаты бенчмарка
Ниже приведена сводка метик submission от NVIDIA:
| Метрика | Значение |
|---|---|
| Пропускная способность (Output throughput) | 52.33 tokens/sec |
| Медианное время до первого токена (TTFT) | 247.12 ms |
| Медианное время на один выходной токен | 14.68 ms |
| Точность BFCL (Berkeley Function Calling Leaderboard) | 87.94% |
| Общее время выполнения workload | 24 min 36 sec |
Почему это важно
Agentic AI требует длительных контекстных окон и многошагового рассуждения, что традиционно упирается в пропускную способность памяти (DRAM bandwidth) на edge-устройствах. Использование NVFP4 не только ускоряет вычисления, но и освобождает место в 128 ГБ унифицированной памяти для хранения длинных контекстов и состояний агента. Разработчики могут начать работу с ветки release/0.9.1-mlpinf библиотеки TensorRT Edge-LLM и готовым квантованным чекпоинтом Qwen3.6-27B.
Бенчмарки
| Бенчмарк | Qwen3.6-27B (TensorRT Edge-LLM) | Qwen3.6-27B (llama.cpp reference) |
|---|---|---|
| MLPerf Inference v6.1 Edge Agentic | 52.33tokens | 8.17tokens |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: NVIDIA dev blog ↗
