raullenchai/Rapid-MLX

The fastest local AI engine for Apple Silicon. 4.2x faster than Ollama, 0.08s cached TTFT, 100% tool calling. 17 tool parsers, prompt cache, reasoning separation, cloud routing. Drop-in OpenAI replacement. Works with Claude Code, Cursor, Aider.

Прочее⭐ 3 801Pythonпоследний релиз: v0.14.3
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Rapid-MLX — это локальный AI-движок для Apple Silicon, выступающий прямой заменой API OpenAI/Anthropic с оптимизацией под MLX.

Зачем нужен

Инструмент обеспечивает высокую скорость генерации (до 4.2x быстрее Ollama) и низкую задержку (0.08s TTFT) на Mac с чипами M1-M4. Он позволяет использовать локальные модели в качестве бэкенда для существующих AI-клиентов без написания адаптеров.

Что можно реализовать

  • Запуск локальных AI-агентов и IDE-ассистентов (Claude Code, Cursor, Aider, GitHub Copilot) с приватными данными.
  • Использование локального бэкенда в фреймворках для разработки агентов (LangChain, PydanticAI, smolagents).
  • Интеграция инструментов (tool calling) в локальные модели с поддержкой 17 парсеров и кэширования промптов.
  • Использование десктопного приложения для работы с vision, файлами, голосом и генерацией изображений на Mac.

Ключевые возможности

  • Drop-in совместимость с OpenAI/Anthropic API: работает с клиентами, ожидающими эти эндпоинты.
  • Высокая производительность на Apple Silicon благодаря оптимизации под MLX.
  • Полная поддержка tool calling (100%) и разделение процессов рассуждения (reasoning separation).
  • Наличие десктопного приложения для macOS и установка через Homebrew/PyPI.
  • Поддержка cloud routing и кэширования промптов для оптимизации затрат и скорости.

👤 Кому подойдёт: разработчики, использующие Apple Silicon, и специалисты по AI, ищущие быстрый локальный бэкенд для агентов и IDE-плагинов

Релизы

v0.14.3minor
🕐 2 дн назад · релиз на GitHub ↗

Ускорение мультимодальных диалогов, локальные задачи Personal Intelligence, полный Community Benchmark и поддержка Bonsai 2.

  • Added: Мультимодальные диалоги стали значительно быстрее за счёт кэширования медиа-префиксов и оптимизации генерации.
  • Added: Personal Intelligence теперь умеет искать, читать, писать файлы и запускать ограниченные команды в безопасном песочнице.
  • Added: Community Benchmark получил полноценный интерфейс с живыми метриками, ETA и поддержкой DeepSeek V4.1.
  • Added: Добавлена нативная поддержка пакетов Bonsai 2 Hadamard MLX с собственным загрузчиком.
  • Fixed: GLM-5.3 Flash теперь работает с длинным контекстом без ошибок Metal OOM благодаря чанковой префилляции.
  • Fixed: Исправлены зависания при остановке serve, проблемы с DNS и бесконечное ожидание в Personal Intelligence.
v0.14.1minor
🕐 10 дн назад · релиз на GitHub ↗

Улучшена работа с PDF, исправлено зависание мультимодального чата и усилены проверки MTP; DeepSeek V4.1 признан слишком медленным.

  • Added: Поддержка анализа больших PDF, сканов и смешанных документов с ограниченным кэшем и таймаутами.
  • Fixed: Исправлено зависание мультимодального чата при зацикливании токенов до исчерпания ресурсов Metal.
  • Added: Усилены проверки корректности декодирования MTP для предотвращения скрытых ошибок распределения.
  • Экспериментальный чекпоинт DeepSeek V4.1 Flash REAP 2-bit признан слишком медленным для каталога.
v0.14.0major
🕐 11 дн назад · релиз на GitHub ↗

Rapid-MLX 0.14.0: ускорение декодирования, экспериментальные Computer Use и Share Compute, новые модели Qwen3.8 и Granite.

  • Added: Измеренное ускорение декодирования и планировщика запросов на Mac M3 Ultra.
  • Added: Экспериментальные функции Computer Use и Share Compute для локального управления и распределения ресурсов.
  • Added: Новые модели: Qwen3.8 27B, Granite 4.2, NeoHorse 1, MiniCPM5 и Qwen3.8 Abliterated.
  • Added: Улучшенный Community Benchmark с прозрачными метриками и условиями запуска.
v0.13.4minor
🕐 18 дн назад · релиз на GitHub ↗

Ускорение Qwen3, локальная генерация видео в Desktop, приватный бенчмарк и улучшение управления памятью.

  • Added: По умолчанию ускорены модели Qwen3.5/3.6/3.8 за счет автоматического выбора MTP и непрерывного планировщика.
  • Added: В Desktop добавлена экспериментальная генерация видео с поддержкой LTX 2.5, Wan 2.1 и CogVideoX-Fun.
  • Added: Community Benchmark теперь работает локально по умолчанию с явным согласием на отправку данных.
  • Fixed: Улучшено управление памятью: точные рекомендации по запуску и корректная обработка ошибок кэширования.
  • Added: Добавлены экспериментальные оптимизации для Qwen3.8 Flash-Next и DFlash2.
v0.13.3minor
🕐 20 дн назад · релиз на GitHub ↗

Добавлена поддержка GLM-5.3-Flash, ускорена работа гибридных моделей и улучшена стабильность Desktop-клиента.

  • Added: Добавлена поддержка модели GLM-5.3-Flash в CLI, сервере и Desktop.
  • Added: Оптимизирована работа гибридных мультимодальных моделей за счет переиспользования текстовых префиксов.
  • Added: В Desktop добавлена палитра команд, система обратной связи и улучшен стриминг Markdown.
  • Fixed: Завершенные видео-задачи теперь сохраняются после перезапуска сервера.
  • Fixed: Улучшена надежность установки Desktop-версии и восстановления движка после сбоев.