mlc-ai/web-llm

High-performance In-browser LLM Inference Engine

Инференс⭐ 19 158TypeScriptпоследний релиз: v0.2.85
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

WebLLM — это высокопроизводительный движок для запуска больших языковых моделей (LLM) прямо в веб-браузере с использованием WebGPU, без необходимости серверной инфраструктуры.

Зачем нужен

Инструмент позволяет выполнять инференс LLM локально на клиенте, обеспечивая полную конфиденциальность данных и снижая затраты на серверы. Он совместим с OpenAI API, что упрощает интеграцию существующих приложений с открытыми моделями.

Что можно реализовать

  • Создание чат-ботов и виртуальных ассистентов с мгновенным откликом (streaming) и сохранением приватности
  • Разработка расширений для Chrome, добавляющих AI-функции в браузер
  • Генерация структурированного JSON-вывода для интеграции с другими системами
  • Демонстрация AI-возможностей в веб-приложениях без бэкенда
  • Локальное тестирование и прототипирование LLM-приложений

Ключевые возможности

  • Полная совместимость с OpenAI API (streaming, JSON-mode, seeding)
  • Аппаратное ускорение через WebGPU для высокой производительности
  • Поддержка множества моделей: Llama 3, Phi 3, Gemma, Mistral, Qwen
  • Возможность загрузки пользовательских моделей в формате MLC
  • Поддержка Web Workers и Service Workers для оптимизации UI

👤 Кому подойдёт: Веб-разработчики, создающие AI-интеграции; стартапы, желающие снизить затраты на серверы; исследователи, изучающие клиентский инференс; разработчики браузерных расширений

Релизы

v0.2.85minor
🕐 13 дн назад · релиз на GitHub ↗

Обновление TVM web runtime, исправление ошибок инициализации и кэширования, а также улучшение совместимости с OpenAI API.

  • Added: Обновлен встроенный TVM web runtime до версии 0.27.0-dev0.
  • Added: Возврат временных меток created в секундах для совместимости с OpenAI API.
  • Fixed: Исправлено зависание при инициализации некорректных структурных ограничений.
  • Fixed: Реализовано сохранение состояния модели в worker для предотвращения повторных загрузок.
  • Fixed: Добавлена регистрация обработчиков service-worker для корректного приема запросов после перезапуска.
v0.2.83minor
🕐 5 мес назад · релиз на GitHub ↗

Web-LLM v0.2.83: поддержка кросс-доменных хранилищ, верификация моделей, рефакторинг чата и обновление TVMJS.

  • Added: Добавлена поддержка кросс-доменных хранилищ.
  • Added: Введена проверка целостности артефактов моделей.
  • Added: Добавлена поддержка подгрупп и пример гейтирования WASM.
  • Added: Рефакторинг регистрации функций llm_chat с учетом состояния kv.
  • Added: Обновлена версия tvmjs до 0.24.0-dev3.
  • Fixed: Исправлены проблемы rollup и обновлены зависимости.