Единая команда для любых моделей
Инструмент OpenLLM от команды BentoML позволяет разработчикам запускать локально или в облаке широкий спектр больших языковых моделей (LLM) с помощью одной команды. Ключевая особенность — предоставление OpenAI-compatible APIs, что гарантирует совместимость с существующими фреймворками, такими как LangChain, LlamaIndex и стандартным Python-клиентом OpenAI.
Для старта достаточно установить пакет через pip и выполнить команду openllm serve. Система автоматически управляет загрузкой весов (требуется Hugging Face token для gated-моделей) и запуском inference-бэкенда.
Поддерживаемые модели и требования к железу
OpenLLM поддерживает актуальные модели, включая Llama 3.3, Qwen2.5, Gemma 2/3, Mistral и Phi-4. Ниже приведена таблица с примерами популярных моделей, их параметрами и минимальными требованиями к GPU для запуска:
| Модель | Параметры | Требования к GPU | Команда запуска |
|---|---|---|---|
| llama3.3 | 70b | 80G x 2 | openllm serve llama3.3:70b |
| llama3.1 | 8b | 24G | openllm serve llama3.1:8b |
| qwen2.5 | 7b | 24G | openllm serve qwen2.5:7b |
| phi4 | 14b | 80G | openllm serve phi4:14b |
| gemma2 | 2b | 12G | openllm serve gemma2:2b |
| deepseek r1-671b | 671b | 80G x 16 | openllm serve deepseek:r1-671b |
Встроенный UI и интеграция с кодом
Помимо API, OpenLLM предоставляет встроенный веб-интерфейс для чата по адресу /chat (по умолчанию http://localhost:3000/chat). Для взаимодействия из кода используется стандартный протокол OpenAI. Пример инициализации клиента на Python:
- Base URL:
http://localhost:3000/v1 - API Key:
na(или любой другой, если настроена аутентификация)
Это позволяет использовать LLM как бэкенд для RAG-систем, агентов или просто для локального тестирования без изменения клиентского кода.
Деплой в облако и кастомные репозитории
OpenLLM интегрируется с BentoCloud — платформой для enterprise-развертывания AI-моделей. Команда openllm deploy позволяет выгрузить модель в облако с автоскейлингом и мониторингом. Также система поддерживает Model Repository: пользователи могут добавлять свои кастомные модели или форкать репозиторий BentoML для участия в комьюнити.
Почему это важно
Инструмент решает проблему фрагментации в экосистеме open-source LLM. Вместо настройки каждого бэкенда (vLLM, HuggingFace Transformers, Ollama) по отдельности, OpenLLM предоставляет единый слой абстракции. Это критично для компаний, которым нужно быстро прототипировать решения на разных моделях (от легких 2B до тяжелых 70B+) и затем масштабировать их в продакшен через BentoCloud.
Источник: Github ↗
