MLC LLM — это универсальный движок для развертывания больших языковых моделей (LLM) с использованием ML-компиляции для оптимизации производительности.
Зачем нужен
Инструмент позволяет разрабатывать, оптимизировать и запускать LLM нативно на широком спектре платформ, от десктопов до мобильных устройств и браузеров. Он обеспечивает высокую производительность инференса через единый движок MLCEngine, предоставляя совместимый с OpenAI API интерфейс для интеграции в различные приложения.
Что можно реализовать
Локальный запуск LLM на устройствах с AMD, NVIDIA, Apple или Intel GPU без необходимости облачных серверов.
Развертывание LLM непосредственно в веб-браузере с использованием WebGPU и WASM.
Создание мобильных приложений для iOS и Android с встроенным AI-инференсом.
Интеграция LLM в кроссплатформенные приложения через REST API, Python или JavaScript SDK.
Ключевые возможности
Поддержка множества аппаратных платформ: AMD GPU, NVIDIA GPU, Apple GPU, Intel GPU.
Работа на различных ОС: Linux, Windows, macOS, iOS, iPadOS, Android.
Запуск LLM в веб-браузере через WebGPU и WASM.
Предоставление OpenAI-compatible API через REST-сервер и клиентские библиотеки.
Использование ML-компиляции (на базе TVM/TensorIR) для автоматической оптимизации производительности.
👤 Кому подойдёт: разработчики, исследователи, инженеры по машинному обучению