Инструменты21 августа 2026 г., 17:47 МСК🤖 Auto

OpenLLM: Запуск LLM одной командой с поддержкой Llama 3.3 и Qwen2.5

BentoML представили OpenLLM — инструмент для развертывания любых open-source моделей в виде OpenAI-совместимых API. Поддержка Llama 3.3, Qwen2.5 и встроенный UI делают самохостинг LLM проще.

Баннер новости 6248

Единая команда для любых моделей

Инструмент OpenLLM от команды BentoML позволяет разработчикам запускать локально или в облаке широкий спектр больших языковых моделей (LLM) с помощью одной команды. Ключевая особенность — предоставление OpenAI-compatible APIs, что гарантирует совместимость с существующими фреймворками, такими как LangChain, LlamaIndex и стандартным Python-клиентом OpenAI.

Для старта достаточно установить пакет через pip и выполнить команду openllm serve. Система автоматически управляет загрузкой весов (требуется Hugging Face token для gated-моделей) и запуском inference-бэкенда.

Поддерживаемые модели и требования к железу

OpenLLM поддерживает актуальные модели, включая Llama 3.3, Qwen2.5, Gemma 2/3, Mistral и Phi-4. Ниже приведена таблица с примерами популярных моделей, их параметрами и минимальными требованиями к GPU для запуска:

Модель Параметры Требования к GPU Команда запуска
llama3.3 70b 80G x 2 openllm serve llama3.3:70b
llama3.1 8b 24G openllm serve llama3.1:8b
qwen2.5 7b 24G openllm serve qwen2.5:7b
phi4 14b 80G openllm serve phi4:14b
gemma2 2b 12G openllm serve gemma2:2b
deepseek r1-671b 671b 80G x 16 openllm serve deepseek:r1-671b

Встроенный UI и интеграция с кодом

Помимо API, OpenLLM предоставляет встроенный веб-интерфейс для чата по адресу /chat (по умолчанию http://localhost:3000/chat). Для взаимодействия из кода используется стандартный протокол OpenAI. Пример инициализации клиента на Python:

  • Base URL: http://localhost:3000/v1
  • API Key: na (или любой другой, если настроена аутентификация)

Это позволяет использовать LLM как бэкенд для RAG-систем, агентов или просто для локального тестирования без изменения клиентского кода.

Деплой в облако и кастомные репозитории

OpenLLM интегрируется с BentoCloud — платформой для enterprise-развертывания AI-моделей. Команда openllm deploy позволяет выгрузить модель в облако с автоскейлингом и мониторингом. Также система поддерживает Model Repository: пользователи могут добавлять свои кастомные модели или форкать репозиторий BentoML для участия в комьюнити.

Почему это важно

Инструмент решает проблему фрагментации в экосистеме open-source LLM. Вместо настройки каждого бэкенда (vLLM, HuggingFace Transformers, Ollama) по отдельности, OpenLLM предоставляет единый слой абстракции. Это критично для компаний, которым нужно быстро прототипировать решения на разных моделях (от легких 2B до тяжелых 70B+) и затем масштабировать их в продакшен через BentoCloud.

Источник: Github ↗