NVIDIA/TensorRT-LLM

TensorRT LLM provides users with an easy-to-use Python API to define Large Language Models (LLMs) and supports state-of-the-art optimizations to perform inference efficiently on NVIDIA GPUs. TensorRT LLM also contains components to create Python and C++ runtimes that orchestrate the inference execution in a performant way.

Инференс⭐ 14 683Pythonпоследний релиз: v1.2.1
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

TensorRT LLM — это оптимизированный фреймворк от NVIDIA для эффективного запуска инференса больших языковых (LLM) и визуальных моделей на GPU.

Зачем нужен

Инструмент позволяет быстро развернуть высокопроизводительные модели, используя специализированные ядра и эффективный runtime. Он полезен для разработчиков, которым нужно максимизировать пропускную способность и минимизировать задержки при обслуживании LLM в продакшене.

Что можно реализовать

  • Развертывание высоконагруженных LLM-серверов с минимальной задержкой
  • Оптимизация работы MoE-моделей (например, DeepSeek) через Expert Parallelism
  • Ускорение инференса длинных контекстов с помощью Skip Softmax Attention
  • Запуск агентов и сложных приложений, требующих совместной оптимизации CPU и GPU

Ключевые возможности

  • Поддержка специализированных ядер для оптимизации вычислений
  • Встроенные механизмы speculative decoding и guided decoding
  • Масштабирование через Expert Parallelism и DWDP (Distributed Weight Data Parallelism)
  • Оптимизация под новые архитектуры GPU, такие как NVIDIA Blackwell
  • Гибкий Python API для кастомизации и расширения функционала

👤 Кому подойдёт: Инженеры по машинному обучению, MLOps-инженеры и разработчики, развертывающие LLM на NVIDIA GPU

Релизы

v1.2.1patch
🕐 5 мес назад · релиз на GitHub ↗

Исправлена критическая ошибка с повреждением KV-кэша и обновлены зависимости xgrammar и flashinfer.

  • Fixed: Устранена проблема, приводившая к повреждению KV-кэша.
  • Added: Обновлены библиотеки xgrammar и flashinfer.