mlc-ai/mlc-llm

Универсальный движок для развертывания LLM с ML-компиляцией

Инференс⭐ 23 171Pythonпоследний релиз: v0.26.dev0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

MLC LLM — это универсальный движок для развертывания больших языковых моделей (LLM) с использованием ML-компиляции для оптимизации производительности.

Зачем нужен

Инструмент позволяет разрабатывать, оптимизировать и запускать LLM нативно на широком спектре платформ, от десктопов до мобильных устройств и браузеров. Он обеспечивает высокую производительность инференса через единый движок MLCEngine, предоставляя совместимый с OpenAI API интерфейс для интеграции в различные приложения.

Что можно реализовать

  • Локальный запуск LLM на устройствах с AMD, NVIDIA, Apple или Intel GPU без необходимости облачных серверов.
  • Развертывание LLM непосредственно в веб-браузере с использованием WebGPU и WASM.
  • Создание мобильных приложений для iOS и Android с встроенным AI-инференсом.
  • Интеграция LLM в кроссплатформенные приложения через REST API, Python или JavaScript SDK.

Ключевые возможности

  • Поддержка множества аппаратных платформ: AMD GPU, NVIDIA GPU, Apple GPU, Intel GPU.
  • Работа на различных ОС: Linux, Windows, macOS, iOS, iPadOS, Android.
  • Запуск LLM в веб-браузере через WebGPU и WASM.
  • Предоставление OpenAI-compatible API через REST-сервер и клиентские библиотеки.
  • Использование ML-компиляции (на базе TVM/TensorIR) для автоматической оптимизации производительности.

👤 Кому подойдёт: разработчики, исследователи, инженеры по машинному обучению

Релизы