Искусственный интеллект перестает быть исключительно облачной технологией. Мы наблюдаем масштабный сдвиг: интеллектуальные агенты, способные к сложному рассуждению и выполнению задач, мигрируют из дата-центров прямо в периферийные устройства — автомобили, роботы и промышленные контроллеры. Однако этот переход сталкивается с фундаментальным вызовом. В отличие от простого чат-бота, который отвечает на один запрос, AI-агент работает в режиме многошагового взаимодействия. Он выбирает инструменты, анализирует их результаты, продолжает рассуждать и формирует все более длинную историю диалога. Такой сценарий накладывает жесткие требования на производительность вывода (inference) на edge-устройствах: модель должна генерировать токены с высокой скоростью, эффективно обрабатывать длинные контексты и при этом укладываться в строгие ограничения по энергопотреблению и объему памяти.
Команда NVIDIA представила впечатляющие результаты оптимизации этой задачи. Используя платформу TensorRT Edge-LLM на одноплатном компьютере NVIDIA Jetson AGX Thor, инженерам удалось запустить модель Qwen3.6-27B в бенчмарке MLPerf Inference v6.1 Edge Agentic. Результат превзошел ожидания: система достигла скорости 52,33 токена в секунду, выполнив все 1007 шагов рабочей нагрузки всего за 24 минуты и 36 секунд. Это на 6,4 раза быстрее, чем эталонная реализация llama.cpp, которая потребовала бы более двух с половиной часов. В этой статье мы подробно разберем, какие архитектурные и программные решения позволили достичь такого прорыва, и как это меняет ландшафт развертывания AI-агентов на периферии.

01Что такое MLPerf Edge Agentic и почему это важно?
Чтобы понять масштаб достижения, необходимо разобраться в методологии тестирования. Бенчмарк MLPerf Edge Agentic — это не просто замер скорости генерации текста. Он измеряет производительность конечной точки (endpoint), совместимой с API OpenAI, в двух ключевых фазах: производительности и точности. Это критически важно, так как в реальных сценариях использования агентов скорость бесполезна, если модель ошибается в выборе инструментов или генерирует невалидный код.
На фазе производительности бенчмарк воспроизводит записанные траектории работы программного агента. Модель получает запрос пользователя, генерирует вызов инструмента (tool call), наблюдает за результатом выполнения этого инструмента и продолжает диалог. Рабочая нагрузка включает 20 различных бесед и 1007 сгенерированных шагов. Длина входных данных неуклонно растет по мере прохождения шагов, достигая примерно 23,5 тысяч токенов. Это делает обработку длинного контекста (long-context processing) одной из центральных проблем, которую необходимо решить для успешного прохождения теста.
Параллельно измеряется точность с использованием метрики Intersection of Union (IoU) для обеспечения корректности работы агента. На фазе точности используются промпты из Berkeley Function Calling Leaderboard (BFCL) v4. Здесь проверяется, правильно ли модель выбирает функцию, генерирует ли валидные аргументы и, что не менее важно, воздерживается ли она от вызова инструмента, когда это не требуется. Только сочетание высокой скорости и высокой точности позволяет говорить о готовности технологии к промышленному внедрению.
02Архитектура Jetson AGX Thor: фундамент для AI-агентов
Сердцем данной оптимизации является аппаратная платформа NVIDIA Jetson AGX Thor Developer Kit. Это устройство представляет собой мощный edge-компьютер, предназначенный для автономных систем и робототехники. Ключевой особенностью Thor является наличие 128 ГБ унифицированной памяти (Unified Memory). В архитектуре NVIDIA GPU и CPU разделяют одну и ту же физическую память, что позволяет избежать дорогостоящих копирований данных между процессором и видеопамятью. Для AI-моделей, особенно тех, которые работают с длинными контекстами и требуют хранения больших объемов KV-кэша, это становится решающим фактором производительности.
В тестировании использовался режим максимальной производительности (MAXN power mode), что позволило раскрыть весь потенциал графического процессора Blackwell, встроенного в Thor. Однако даже при таком режиме пропускная способность памяти (DRAM bandwidth) остается «узким горлышком» для декодирования больших языковых моделей (LLM) с малыми батчами. Именно поэтому оптимизация использования памяти и снижение накладных расходов на передачу данных стали главными целями команды разработчиков TensorRT Edge-LLM.

03NVFP4 и FP8: революция в квантовании
Одним из главных инструментов ускорения стало применение продвинутых форматов квантования. Стандартные модели часто используют 16-битные числа с плавающей запятой (FP16) или даже 32-битные (FP32). Однако для edge-устройств это слишком ресурсоемко. NVIDIA внедрила формат NVFP4 (4-битная плавающая точка) для весов и активаций модели Qwen3.6-27B, включая голову языковой модели. NVFP4 поддерживается аппаратно на GPU архитектуры Blackwell, что обеспечивает вычислительную эффективность без значительной потери точности.
Параллельно для кэша ключей и значений (KV cache) используется формат FP8. KV cache — это структура данных, которая хранит промежуточные результаты вычислений для каждого токена в контексте, чтобы не пересчитывать их заново при генерации следующего токена. При длине контекста в 23,5K токенов объем KV cache может стать огромным. Использование FP8 позволяет сократить его размер вдвое по сравнению с FP16, освобождая драгоценное пространство в 128 ГБ унифицированной памяти для других задач и состояний декодирования.
Для внедрения этого подхода NVIDIA предоставляет калиброванные чекпоинты Qwen3.6-27B NVFP4. Разработчики могут начать с готового решения или выполнить постобучающее квантование (post-training quantization) на любой системе разработки перед развертыванием на edge-устройстве. TensorRT Edge-LLM использует оптимизированные ядра (kernels), которые ускоряют работу квантованных моделей, сохраняя точность, необходимую для прохождения бенчмарка MLPerf.

04Повторное использование KV cache: секрет эффективности
В сценариях работы AI-агентов каждый новый запрос содержит почти всю предыдущую историю разговора плюс новый ответ модели или результат выполнения инструмента. Без оптимизации модели пришлось бы заново пропускать через себя всю эту общую историю (prefill) на каждом шаге. Стоимость таких вычислений растет экспоненциально по мере роста диалога.
TensorRT Edge-LLM решает эту проблему, идентифицируя повторяющиеся префиксы промптов и восстанавливая их кэшированные страницы внимания (KV pages). Поскольку Qwen3.6 использует гибридную архитектуру модели, среда выполнения также восстанавливает рекуррентное состояние и частичное состояние KV-страниц, необходимое для корректного продолжения выполнения. Таким образом, модель выполняет prefill только для новой части диалога (суффикса), игнорируя уже обработанную историю.
Результат этой оптимизации впечатляет: примерно 96% токенов промпта обслуживаются из «горячего» кэша. За время всего тестирования среда выполнения заново выполняла prefill только для ~0,5 миллиона из 13,6 миллиона общих токенов промпта. Это радикально снижает вычислительную нагрузку на этапе подготовки контекста, позволяя сосредоточить ресурсы на генерации новых токенов.

05Древовидное много-токенное предсказание (Tree-based MTP)
Вторым ключевым компонентом ускорения является метод много-токенного предсказания (Multi-Token Prediction, MTP). В стандартном авторегрессионном декодировании модель генерирует один токен за один вызов. MTP использует модель-черновик (draft model) для предсказания нескольких будущих токенов, которые затем целевая модель (target model) проверяет вместе за один проход.
TensorRT Edge-LLM реализует не линейное, а древовидное MTP. Вместо того чтобы держать только одну предполагаемую продолжение, среда выполнения организует наиболее вероятные кандидаты в дерево. Целевая модель проверяет эти кандидаты за один прямой проход (forward pass), и среда выполнения принимает совпадающий путь. Если принимаются несколько кандидатов, система продвигает генерацию сразу несколькими токенами.
В конфигурации MLPerf использовались параметры: 8 шагов черновика, топ-2 кандидата на каждой глубине черновика и дерево верификации из 16 узлов. Древовидная верификация особенно полезна для вызова функций (function calling), так как имена инструментов, синтаксис JSON и общие структуры аргументов часто предсказуемы. При этом несколько ветвей позволяют сохранять альтернативы для конкретных значений аргументов. По сравнению с линейным MTP с 3 шагами черновика, древовидное MTP дало дополнительный прирост производительности декодирования примерно на 40% для данной рабочей нагрузки.

06Практическое руководство: как запустить benchmark
Для разработчиков, желающих повторить эти результаты или интегрировать подобные оптимизации в свои проекты, NVIDIA открыла доступ к коду. Реализация доступна в ветке release/0.9.1-mlpinf репозитория TensorRT Edge-LLM. Ниже приведена пошаговая инструкция по настройке окружения и запуску бенчмарка.
Сначала необходимо клонировать репозиторий и инициализировать подмодули:
git clone --branch release/0.9.1-mlpinf \
https://github.com/NVIDIA/TensorRT-Edge-LLM.git
cd TensorRT-Edge-LLM
git submodule update --init --recursiveЗатем скачайте калиброванный чекпоинт NVFP4 с Hugging Face:
huggingface-cli download \
centml/Qwen3.6-27B-NVFP4-W4A4-mlpinf \
--local-dir "$WORK/Qwen3.6-27B-NVFP4-W4A4-mlpinf"После этого следуйте инструкциям в файле mlperf/README.md для сборки TensorRT Edge-LLM, экспорта чекпоинта с интерфейсом tree-MTP и сборки базовых и черновых движков TensorRT. Команда экспорта выглядит следующим образом:
$VENV/bin/python -m tensorrt_edgellm.scripts.export \
"$WORK/Qwen3.6-27B-NVFP4-W4A4-mlpinf" \
"$WORK/onnx" \
--mtp-tree-base --skip-visualЗапустите сервер, совместимый с OpenAI:
export REPO="$PWD"
export VENV=/path/to/venv-edgellm-export
export WORK=/path/to/mlperf-artifacts
bash mlperf/serve_edgellm.shНаконец, клонируйте harness для MLCommons, установите зависимости BFCL, обновите пути в конфигурационном файле mlperf/config.yaml и запустите бенчмарк:
git clone https://github.com/mlcommons/endpoints.git
cd endpoints
python3.12 -m venv .venv
source .venv/bin/activate
pip install -e ".[dev,bfcl]"
inference-endpoint benchmark from-config \
--config "$REPO/mlperf/config.yaml"Предоставленная конфигурация запускает фазы производительности и точности с температурой 0, сидом 42, отключенным рассуждением (reasoning) и конкурентностью 1. Вы можете использовать флаг --accuracy-only для запуска только фазы точности BFCL. Для получения полных результатов MLPerf Inference v6.1 обратитесь к официальному объявлению MLCommons.
07Что это значит на практике
Результаты тестирования TensorRT Edge-LLM на Jetson AGX Thor демонстрируют, что запуск сложных AI-агентов на периферии больше не является теоретической возможностью. Скорость в 52,33 токена в секунду и время выполнения всего в 24 минуты для сложной многошаговой задачи делают возможным создание автономных систем, которые реагируют на изменения среды в реальном времени. Это критически важно для автономного вождения, где задержка в принятии решений может стоить жизни, или для промышленных роботов, требующих мгновенной адаптации к новым условиям.
Использование NVFP4 и FP8 позволяет эффективно использовать ограниченную память edge-устройств, а техники повторного использования кэша и древовидного предсказания токенов устраняют основные узкие места производительности. Для разработчиков это означает, что они могут развертывать более мощные модели (такие как Qwen3.6-27B) на компактных и энергоэффективных платформах, таких как Jetson, без необходимости облачной инфраструктуры. Это открывает путь к созданию полностью автономных AI-систем, способных воспринимать, рассуждать и действовать в реальном мире, обеспечивая при этом конфиденциальность данных и надежность работы в условиях отсутствия стабильного соединения с интернетом.
Команда NVIDIA продолжает работу над улучшением этих технологий, и мы ожидаем появления новых оптимизаций в будущих версиях TensorRT Edge-LLM. Разработчикам стоит внимательно следить за обновлениями репозитория и экспериментировать с предоставленными чекпоинтами, чтобы интегрировать передовые методы оптимизации в свои проекты уже сегодня.
Источник: NVIDIA Developer ↗
