LLMServe/DistServe
Система распределенного обслуживания для больших языковых моделей (LLMs).
Инференс⭐ 838Jupyter Notebook
Что это за инструмент
DistServe — это система обслуживания LLM, разделяющая вычисления фаз префилла и декодирования на разные ресурсы.
Зачем нужен
Инструмент решает проблему интерференции и сложного управления ресурсами при совместном запуске фаз префилла и декодирования. Он позволяет независимо настраивать параллелизм и планирование для каждой фазы, автоматически управляя передачей KV-Cache и памятью.
Что можно реализовать
- Оптимизация пропускной способности (goodput) при обслуживании больших языковых моделей
- Запуск офлайн-инференса на кластере GPU с использованием Ray
- Развертывание онлайн API-сервера для LLM с разделением вычислительных нагрузок
- Воспроизведение экспериментов из исследовательской статьи по распределенному обслуживанию
Ключевые возможности
- Архитектура с разделением (disaggregation) фаз префилла и декодирования
- Использование высокопроизводительного бэкенда SwiftTransformer (C++)
- Поддержка FlashAttention, Continuous Batching и PagedAttention
- Автоматическое управление коммуникацией KV-Cache и памятью
- Поддержка моделей GPT-2, OPT и LLaMA2
👤 Кому подойдёт: Исследователи и разработчики, занимающиеся оптимизацией инфраструктуры для LLM serving и распределенных вычислений.
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.