Исправлена критическая ошибка с повреждением KV-кэша и обновлены зависимости xgrammar и flashinfer.
- Fixed: Устранена проблема, приводившая к повреждению KV-кэша.
- Added: Обновлены библиотеки xgrammar и flashinfer.
TensorRT LLM provides users with an easy-to-use Python API to define Large Language Models (LLMs) and supports state-of-the-art optimizations to perform inference efficiently on NVIDIA GPUs. TensorRT LLM also contains components to create Python and C++ runtimes that orchestrate the inference execution in a performant way.
TensorRT LLM — это оптимизированный фреймворк от NVIDIA для эффективного запуска инференса больших языковых (LLM) и визуальных моделей на GPU.
Инструмент позволяет быстро развернуть высокопроизводительные модели, используя специализированные ядра и эффективный runtime. Он полезен для разработчиков, которым нужно максимизировать пропускную способность и минимизировать задержки при обслуживании LLM в продакшене.
👤 Кому подойдёт: Инженеры по машинному обучению, MLOps-инженеры и разработчики, развертывающие LLM на NVIDIA GPU
Исправлена критическая ошибка с повреждением KV-кэша и обновлены зависимости xgrammar и flashinfer.