lemonade-sdk/lemonade

Lemonade помогает пользователям находить и запускать локальные AI-приложения, предоставляя оптимизированные LLM прямо с их GPU и NPU. Присоединяйтесь к нашему Discord: https://discord.gg/5xXzkMu8Zk

Инференс⭐ 5 756C++последний релиз: v11.9.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Lemonade — это локальный AI-сервер, позволяющий запускать оптимизированные LLM, генерацию изображений и речи прямо на GPU и NPU пользователя.

Зачем нужен

Инструмент предоставляет бесплатные и приватные возможности, аналогичные облачным API, но работающие полностью офлайн. Он поддерживает два режима: установку сервера для подключения сторонних приложений через стандартные API (OpenAI, Anthropic, Ollama) и встраиваемую библиотеку для разработки собственных приложений с автооптимизацией под железо.

Что можно реализовать

  • Запуск локальных LLM для чата, кодинга и генерации изображений без отправки данных в облако
  • Интеграция локальных моделей в популярные приложения (Open WebUI, Dify, n8n, AnythingLLM) через совместимые API
  • Разработка мобильных приложений с поддержкой мульти-модального AI для iOS и Android
  • Встраивание AI-функционала в собственные десктопные или серверные продукты с помощью Embeddable Lemonade

Ключевые возможности

  • Поддержка стандартизированных API (OpenAI, Anthropic, Ollama) для легкой интеграции
  • Глубокая оптимизация для AMD Ryzen AI, Radeon и Strix Halo
  • Наличие мобильного приложения для iOS и Android
  • Встроенный менеджер моделей и интерфейсы для генерации текста, изображений и речи
  • Открытый исходный код и лицензия Apache

👤 Кому подойдёт: разработчики, пользователи с оборудованием AMD, энтузиасты локального AI, создатели мобильных и десктопных приложений

Релизы

v11.9.0majorbreaking
🕐 18 дн назад · релиз на GitHub ↗

Исправлены таймауты и CORS, добавлена поддержка Qwen3 и экспериментальный бэкенд AMD HRX, изменена структура моделей.

  • Fixed: Исправлено блокирование удалённого доступа через allowed_origins и увеличен стандартный таймаут префилла до 600 секунд.
  • Added: Добавлен экспериментальный бэкенд llamacpp-hrx для работы с AMD HRX на Linux.
  • Added: Обновлена версия llama.cpp для поддержки модели Qwen3-Next.
  • Breaking: Модели в папках chat/, embeddings/ и reranking/ теперь отображаются индивидуально, а не как единая группа.
  • Deprecated: Переменная окружения LEMONADE_ALLOWED_ORIGINS устарела, рекомендуется использовать опцию allowed_origins.
v11.8.1minorbreaking
🕐 24 дн назад · релиз на GitHub ↗

Исправлен регресс v11.8.0 с потерей моделей, изменён путь кэша HuggingFace, удалена поддержка Ubuntu 25.10.

  • Fixed: Systemd-апгрейды теперь корректно восстанавливают конфигурацию и сохранённые модели, исправляя регресс v11.8.0.
  • Breaking: Убран редирект HF_HOME: модели HuggingFace теперь хранятся в /var/lib/lemonade/.cache/huggingface.
  • Deprecated: Удалена поддержка Ubuntu 25.10, так как она достигла конца жизненного цикла (EOL).
v11.8.0majorbreaking
🕐 25 дн назад · релиз на GitHub ↗

Релиз v11.8.0: новый бэкенд DwarfStar для AMD, автообновление моделей, улучшенная работа с загрузкой и ряд ломающих изменений.

  • Added: Добавлен экспериментальный бэкенд ds4 (DwarfStar) для работы с DeepSeek V4 Flash на GPU AMD Strix Halo.
  • Added: В каталог добавлены модели RPG-HaloTales-V2, Flux-2-Klein-4B/9B, а также новые модели OpenMOSS для синтеза речи.
  • Added: Появилась команда lemonade update-models и настройки для автоматического обновления моделей.
  • Added: Улучшена работа с загрузкой: добавлена поддержка возобновления прерванных скачиваний и ограничение скорости.
  • Breaking: Флаги --port и --host больше не сохраняются в конфиг; теперь нужно использовать команду lemonade config set.
  • Breaking: Изменено поведение аргументов: merge_args=false теперь подавляет унаследованные аргументы, а llama.cpp по умолчанию отключает параллельное батчинг.
v11.7.0majorbreaking
🕐 1 мес назад · релиз на GitHub ↗

Релиз v11.7.0: новые модели, поддержка Windows/macOS, API для регистрации моделей и строгие проверки конфигурации.

  • Added: Добавлены модели Qwen3.8-27B, NVIDIA Nemotron 3.5 Lightning 30B-A3B и Z-Image-Turbo.
  • Added: Появились эндпоинты для регистрации моделей без загрузки файлов и управления опциями.
  • Added: Вышла официальная установка через winget для Windows и Homebrew для macOS.
  • Breaking: POST /pull теперь возвращает 400 при несовместимых режимах развертывания без автоисправления.
  • Breaking: Изменен формат ответа /v1/audio/transcriptions: теперь возвращается чистый текст вместо JSON.
v11.6.0majorbreaking
🕐 1 мес назад · релиз на GitHub ↗

v11.6.0: добавлена модель Muse-Glimmer-30B, поддержка AMD Instinct, алиасы моделей и новые бенчмарки.

  • Added: В каталог llama.cpp добавлена модель Muse-Glimmer-30B-GGUF с поддержкой draft decoding, зрения и вызова инструментов.
  • Added: Бэкенд llama.cpp ROCm теперь работает на видеокартах AMD Instinct MI100, MI200, MI210 и MI250.
  • Added: Появились экспериментальные команды `lemonade alias` для назначения собственных имен моделям и `lemonade bench` для тестирования мультимодальных моделей.
  • Added: Добавлен экспериментальный бэкенд TheNoise для генерации изображений на AMD Strix Halo и Strix Point.
  • Breaking: Запрос `/v1/audio/speech` к Kokoro с форматом mp3 теперь возвращает ошибку 400, так как поддерживается только pcm.
  • Breaking: Эндпоинт `/v1/models` теперь отображает каждую квантованную GGUF-модель из подпапок `extra_models_dir` как отдельную запись.
v11.5.2minor
🕐 1 мес назад · релиз на GitHub ↗

lemonade-tray теперь поддерживает HTTPS, сохранены повторяющиеся аргументы llama.cpp, добавлена информация о железе в бенчмарк.

  • Added: Клиент lemonade-tray для macOS и Linux теперь поддерживает подключение к серверам по HTTPS/TLS.
  • Fixed: Исправлено сохранение всех повторов аргументов llama.cpp (например, --override-kv), ранее оставалось только последнее значение.
  • Added: В вывод lemonade bench добавлен раздел с информацией о железе: CPU, GPU, RAM, ОС и бэкендах.
  • Fixed: Бэкенд llama.cpp теперь возвращает понятную ошибку при конфликте явного префикса устройства с выбранным бэкендом.
  • Fixed: Установщик Windows MSI теперь корректно восстанавливает сохранённое пользовательское место установки при обновлении.
v11.5.1majorbreaking
🕐 1 мес назад · релиз на GitHub ↗

lemonade bench для генерации изображений, отладка роутера, 10 моделей MiniCPM, фикс tool-calling и брейки в API.

  • Added: lemonade bench получил режим бенчмарка для генерации изображений с фильтрацией и захватом ответов.
  • Added: Router Builder получил вкладку Test Prompt для отладки политик маршрутизации через новый API-эндпоинт.
  • Added: В каталог llama.cpp добавлены 10 моделей MiniCPM (текст и vision) в формате GGUF.
  • Fixed: Исправлен лимит грамматики llama.cpp, теперь принимаются запросы tool-calling с большими JSON-схемами.
  • Breaking: В поле model теперь возвращается идентификатор модели, а не локальный путь к .gguf файлу.
  • Breaking: Выбор бэкенда auto теперь предпочитает Vulkan на AMD-системах для всех движков.