alibaba/rtp-llm

RTP-LLM: высокопроизводительный inference-движок для LLM от Alibaba для различных приложений.

Инференс⭐ 1 343Cudaпоследний релиз: v0.2.0
Открыть на GitHub ↗

Что это за инструмент

RTP-LLM — это высокопроизводительный движок для инференса больших языковых моделей (LLM), разработанный Alibaba и активно используемый в их внутренних сервисах.

Зачем нужен

Инструмент оптимизирует скорость и эффективность обработки запросов к LLM за счет продвинутых техник квантования, управления памятью и параллелизма. Он полезен для снижения затрат на инфраструктуру и повышения пропускной способности при развертывании моделей в продакшене.

Что можно реализовать

  • Развертывание высоконагруженных сервисов LLM для внутренних продуктов Alibaba (Taobao, Amap и др.)
  • Инференс мультимодальных моделей с поддержкой изображений и текста
  • Оптимизация работы с длинными контекстами через кэширование префиксов (Prefix Cache)
  • Запуск нескольких сервисов LoRA на одном экземпляре модели для экономии ресурсов

Ключевые возможности

  • Поддержка квантования весов (INT8, INT4) и адаптивного квантования KVCache
  • Использование оптимизированных CUDA-ядер: PagedAttention, FlashAttention, FlashDecoding
  • Возможность разделения этапов Prefill и Decode для повышения эффективности
  • Специальная оптимизация для GPU NVIDIA V100 и поддержка AMD ROCm/Intel/ARM CPU
  • Совместимость с форматами HuggingFace, SafeTensors, Pytorch и Megatron

👤 Кому подойдёт: Инженеры по машинному обучению (MLE), DevOps-инженеры, занимающиеся развертыванием LLM, и исследователи, работающие с оптимизацией инференса.

Релизы