Michael-A-Kuykendall/shimmy

⚡ Чистый Rust WebGPU inference engine — совместим с OpenAI API, нативно поддерживает GGUF, работает на любом GPU. Без Python. Без llama.cpp. Один бинарник.

Инференс⭐ 5 900Rustпоследний релиз: v2.6.4
Открыть на GitHub ↗

Что это за инструмент

Shimmy — это легковесный сервер для локального запуска LLM на базе WebGPU, написанный на чистом Rust без зависимостей Python или C++. Он предоставляет полностью совместимый с OpenAI API интерфейс для работы с GGUF-моделями.

Зачем нужен

Инструмент позволяет запускать локальные LLM-серверы с минимальными системными требованиями, заменяя тяжелые решения вроде llama.cpp. Он полезен для разработчиков, которым нужен быстрый, безопасный и простой способ интеграции локальных моделей в существующие приложения, использующие OpenAI SDK.

Что можно реализовать

  • Запуск LLM на слабых GPU (от 2.5 GB VRAM) благодаря сжатию KV-кэша TurboShimmy INT4
  • Интеграция локальных моделей в приложения, использующие стандартные OpenAI SDK и инструменты
  • Развертывание AI-сервисов в контейнерах (Docker) или системах без Python/C++ toolchain
  • Работа с длинным контекстом (YaRN RoPE scaling) на ограниченном оборудовании

Ключевые возможности

  • Чистый Rust и WebGPU (WGSL): отсутствие зависимостей от C++, Python или внешних бинарников
  • Полная совместимость с OpenAI API: готовые клиенты и инструменты работают без изменений
  • TurboShimmy INT4 KV: снижение потребления VRAM KV-кэша в ~7 раз без потери качества
  • Автодетект метаданных из GGUF: не требует ручного указания параметров модели
  • Единый бинарный файл: простое скачивание и запуск без сложной сборки

👤 Кому подойдёт: разработчики, DevOps-инженеры, энтузиасты локальных LLM, использующие Linux/Windows/macOS и желающие минимизировать зависимости проекта

Релизы

v2.6.4patch
🕐 21 дн назад · релиз на GitHub ↗

Релиз v2.6.4 репозитория shimmy не содержит изменений, это пустой патч.

  • В релизе v2.6.4 отсутствуют заметные изменения, исправления или новые функции.
v2.6.0minor
🕐 25 дн назад · релиз на GitHub ↗

Выпуск v2.6.0: добавлена поддержка моделей DeepSeek-V4 и Qwen3, улучшена работа с MCP и оптимизация через FlashAttention.

  • Added: Добавлена поддержка моделей DeepSeek-V4 и Qwen3.
  • Added: Реализована интеграция с MCP (Model Context Protocol).
  • Added: Внедрена оптимизация вычислений с использованием FlashAttention.
  • Fixed: Исправлены ошибки в обработке контекста и управлении памятью.
  • Fixed: Устранены проблемы с совместимостью на некоторых платформах.
v2.5.0minor
🕐 1 мес назад · релиз на GitHub ↗

Релиз v2.5.0: добавлена поддержка моделей DeepSeek-V4 и Qwen3, улучшена работа с FlashAttention и MCP.

  • Added: Добавлена поддержка моделей DeepSeek-V4 и Qwen3.
  • Added: Внедрена поддержка протокола MCP.
  • Added: Оптимизирована работа с FlashAttention.
  • Fixed: Исправлены ошибки в логике обработки запросов.
v2.4.2patch
🕐 1 мес назад · релиз на GitHub ↗

Релиз v2.4.2 репозитория shimmy: исправления и улучшения стабильности.

  • Fixed: Устранены ошибки в обработке контекста и улучшена общая стабильность работы.
  • Fixed: Исправлены мелкие баги, влияющие на производительность системы.
  • Обновлены зависимости и улучшена совместимость с текущей средой выполнения.
v2.1.1patch
🕐 3 мес назад · релиз на GitHub ↗

Релиз v2.1.1: исправление ошибок и улучшение стабильности работы Shimmy.

  • Fixed: Исправлены ошибки, улучшена стабильность работы.