LLMServe/DistServe

Система распределенного обслуживания для больших языковых моделей (LLMs).

Инференс⭐ 838Jupyter Notebook
Открыть на GitHub ↗

Что это за инструмент

DistServe — это система обслуживания LLM, разделяющая вычисления фаз префилла и декодирования на разные ресурсы.

Зачем нужен

Инструмент решает проблему интерференции и сложного управления ресурсами при совместном запуске фаз префилла и декодирования. Он позволяет независимо настраивать параллелизм и планирование для каждой фазы, автоматически управляя передачей KV-Cache и памятью.

Что можно реализовать

  • Оптимизация пропускной способности (goodput) при обслуживании больших языковых моделей
  • Запуск офлайн-инференса на кластере GPU с использованием Ray
  • Развертывание онлайн API-сервера для LLM с разделением вычислительных нагрузок
  • Воспроизведение экспериментов из исследовательской статьи по распределенному обслуживанию

Ключевые возможности

  • Архитектура с разделением (disaggregation) фаз префилла и декодирования
  • Использование высокопроизводительного бэкенда SwiftTransformer (C++)
  • Поддержка FlashAttention, Continuous Batching и PagedAttention
  • Автоматическое управление коммуникацией KV-Cache и памятью
  • Поддержка моделей GPT-2, OPT и LLaMA2

👤 Кому подойдёт: Исследователи и разработчики, занимающиеся оптимизацией инфраструктуры для LLM serving и распределенных вычислений.

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.