bentoml/OpenLLM

Запускайте любые открытые LLM, такие как DeepSeek и Llama, как совместимые с OpenAI API-эндпоинты в облаке.

Инференс⭐ 12 542Pythonпоследний релиз: v0.6.30
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

OpenLLM — это инструмент для локального запуска любых открытых LLM (Llama, DeepSeek, Qwen и др.) в виде API, совместимого с OpenAI.

Зачем нужен

Позволяет разработчикам развернуть собственные LLM-серверы одной командой, обеспечивая совместимость с экосистемой OpenAI. Это полезно для создания приватных AI-инфраструктур, где данные не покидают локальную сеть, и для интеграции открытых моделей в существующие приложения.

Что можно реализовать

  • Запуск локального LLM-сервера для использования с фреймворками RAG, такими как LlamaIndex.
  • Создание кастомных AI-агентов, использующих открытые модели вместо платных API.
  • Развертывание LLM в контейнерах Docker или Kubernetes для корпоративных облачных сред.
  • Использование встроенного веб-интерфейса для тестирования и взаимодействия с моделями.

Ключевые возможности

  • Поддержка широкого спектра моделей: Llama 3.3, Qwen2.5, Phi3, DeepSeek и других.
  • Полная совместимость с OpenAI API (endpoints /v1), что позволяет использовать стандартные клиенты.
  • Встроенный Chat UI для быстрого взаимодействия с моделями через браузер.
  • Простая установка и запуск через pip и одну команду CLI.
  • Готовые решения для деплоя в облаке через BentoCloud, Docker и Kubernetes.

👤 Кому подойдёт: Разработчики, Data Scientists, DevOps-инженеры, работающие с открытыми LLM и нуждающиеся в простом способе их хостинга и интеграции.

Релизы

v0.6.30minor
🕐 17 мес назад · релиз на GitHub ↗

Релиз OpenLLM v0.6.30: добавлена поддержка Qwen3, DeepSeek-V4 и MoE-моделей, улучшена интеграция с MCP.

  • Added: Добавлена поддержка новых моделей: Qwen3, DeepSeek-V4 и архитектур MoE.
  • Added: Улучшена интеграция с протоколом MCP для более стабильной работы.
  • Added: Оптимизирована работа с FlashAttention для ускорения инференса.
  • Fixed: Исправлены ошибки в конфигурации серверов для некоторых моделей.