predibase/lorax

Сервер инференса Multi-LoRA, масштабируемый до тысяч дообученных LLM

Инференс⭐ 3 832Pythonпоследний релиз: lorax-0.4.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

LoRAX — это сервер инференса для LLM, оптимизированный для одновременной работы с тысячами LoRA-адаптеров на одной GPU.

Зачем нужен

Инструмент решает проблему высокой стоимости обслуживания множества дообученных моделей, позволяя динамически загружать адаптеры без блокировки запросов. Это обеспечивает высокую пропускную способность и низкую задержку, сохраняя при этом экономическую эффективность за счет разделения базовой модели.

Что можно реализовать

  • Serving тысяч кастомных моделей для разных клиентов (multi-tenant) на одной инфраструктуре
  • Быстрое переключение между специализированными адаптерами для разных задач (например, разные стили письма или домены)
  • Создание ансамблей моделей путем объединения нескольких LoRA-адаптеров в реальном времени
  • Интеграция с существующими системами через совместимый с OpenAI API для чатов

Ключевые возможности

  • Динамическая загрузка адаптеров (Dynamic Adapter Loading) без блокировки потока запросов
  • Гетерогенное непрерывное батчинг (Heterogeneous Continuous Batching) для оптимизации использования GPU
  • Асинхронное_prefetching_ и выгрузка адаптеров между GPU и CPU памятью
  • Поддержка квантования (bitsandbytes, GPT-Q, AWQ) и оптимизаций вроде Flash Attention
  • Готовность к продакшену: Docker, Helm, метрики Prometheus и OpenTelemetry

👤 Кому подойдёт: ML-инженеры, DevOps-специалисты и компании, развертывающие LLM в продакшене, которым нужно масштабировать обслуживание множества дообученных моделей с минимальными затратами на GPU.

Релизы

lorax-0.4.0major
🕐 20 мес назад · релиз на GitHub ↗

LoRAX 0.4.0 — open-source фреймворк для продакшн-сервинга сотен fine-tuned LLM по цене одной модели.

  • Added: Возможность обслуживания сотен fine-tuned LLM в production-среде с экономией ресурсов.
  • Added: Архитектура позволяет запускать множество моделей, используя вычислительные мощности одной.
  • LoRAX позиционируется как open-source решение для эффективного масштабирования LLM.