Blaizzy/mlx-audio

Библиотека TTS, STT и STS на базе MLX от Apple, обеспечивающая эффективный анализ речи на Apple Silicon.

Аудио⭐ 7 920Pythonпоследний релиз: v0.5.4
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

MLX-Audio — это библиотека для обработки аудио на базе фреймворка Apple MLX, обеспечивающая быструю работу с моделями TTS, STT и STS на чипах Apple Silicon.

Зачем нужен

Инструмент решает задачу эффективного синтеза речи, распознавания речи и преобразования голоса непосредственно на устройствах Apple, без необходимости использования облачных сервисов. Он полезен разработчикам, которым нужна оптимизированная работа с аудио-моделями (включая квантование) и возможность интеграции через REST API или Python API.

Что можно реализовать

  • Локальный синтез речи (TTS) с поддержкой клонирования голоса и мультиязычности (например, через модели Kokoro или Qwen3-TTS).
  • Распознавание речи (STT) и преобразование речи в речь (STS) на устройствах Apple без задержек, связанных с сетью.
  • Создание интерактивных веб-интерфейсов с 3D-визуализацией аудио и OpenAI-совместимым REST API для интеграции в приложения.
  • Разработка iOS/macOS приложений с использованием Swift-пакета для обработки аудио в реальном времени.

Ключевые возможности

  • Высокая скорость инференса, оптимизированная специально для Apple Silicon (M-серия чипов).
  • Поддержка квантования моделей (3-bit, 4-bit, 6-bit, 8-bit) для снижения потребления памяти и ускорения работы.
  • Широкий выбор архитектур моделей: от компактных KittenTTS до мощных Higgs Audio v3 и OmniVoice с поддержкой сотен языков.
  • Наличие готового веб-интерфейса и сервера API, а также Swift-пакета для нативной интеграции.
  • Возможность потоковой генерации аудио (streaming) и сохранения результатов на диск.

👤 Кому подойдёт: разработчики, работающие с Apple Silicon, исследователи в области NLP и аудио, создатели приложений для iOS/macOS

Релизы

v0.5.4minor
🕐 6 дн назад · релиз на GitHub ↗

Добавлена поддержка потоковой передачи Nemotron STT, новая TTS rumik-oss 1 и ускорение VibeVoice-ASR.

  • Added: Добавлена поддержка потоковой передачи Nemotron STT для живого ввода.
  • Added: Появилась новая модель TTS rumik-oss 1 (Cohere2 + Mimi) с поддержкой стриминга.
  • Added: Ускорено декодирование VibeVoice-ASR за счёт оптимизации типов данных.
  • Fixed: Исправлен тестовый буфер clipping для корректной работы с FLAC через ffmpeg.
v0.5.3patch
🕐 13 дн назад · релиз на GitHub ↗

Выпуск версии 0.5.3 с улучшенной обработкой аргументов для модели Granite Speech.

  • Fixed: Улучшена обработка именованных аргументов (kwargs) для модели Granite Speech.
  • Версия библиотеки обновлена до 0.5.3.
v0.5.2minor
🕐 14 дн назад · релиз на GitHub ↗

Релиз v0.5.2: добавлена поддержка новых моделей (VibeVoice, Nemotron, MiMo), улучшена стабильность Voxtral и Omnivoice.

  • Added: Добавлена поддержка моделей VibeVoice-ASR-Streaming, NVIDIA NemotronLabs VoiceChat, DialogueSidon и MiMo-Audio STS.
  • Added: Реализована поддержка сегментации в Breeze TTS и добавлена документация для VoxCPM2.
  • Fixed: Исправлена ошибка в Voxtral: остановка генерации теперь корректно работает на токене <pad>.
  • Fixed: Устранена проблема с неизвестными аргументами STT, вызывавшая сбои генерации.
  • Fixed: Исправлено скрытое подавление ошибок загрузки токенизатора в Omnivoice.
v0.5.1minor
🕐 20 дн назад · релиз на GitHub ↗

Релиз v0.5.1: добавлены модели Breeze-TTS-2, Phonon-1 и Granite Speech 5.0, улучшена работа Qwen3-TTS и Whisper.

  • Added: Добавлена поддержка моделей Breeze-TTS-2, Phonon-1 STT и Granite Speech 5.0 STT.
  • Added: Реализовано потоковое (streaming) генерирование для модели VibeVoice.
  • Fixed: Исправлена работа Qwen3-TTS: устранено ускорение темпа речи и добавлена проверка поддерживаемых голосов.
  • Fixed: Улучшена логика декодирования Whisper: корректная обработка repetition_penalty и фильтрация тишины.
  • Fixed: Исправлено декодирование аудиоформатов CAF и маршрутизация mp4/m4b через ffmpeg.
v0.5.0minor
🕐 1 мес назад · релиз на GitHub ↗

Релиз v0.5.0: добавлена поддержка TTS Irodori v4/v4.1-Small, генерации музыки MiniMax Music 3 и унифицированы горячие слова для STT.

  • Added: Добавлена поддержка моделей TTS Irodori v4 и новых версий Irodori v4.1-Small.
  • Added: Реализован инференс для генерации музыки через модель MiniMax Music 3.
  • Added: Унифицирована поддержка горячих слов (hotwords) для всех бэкендов распознавания речи (STT).
  • Fixed: Исправлена обработка ошибок потоковой передачи: теперь ошибки инференса передаются в потоке ndjson, а не просто возвращают пустой ответ 200.
  • Added: Компоненты библиотеки mlx-lm интегрированы в проект (vendoring).
v0.4.8minor
🕐 1 мес назад · релиз на GitHub ↗

Исправлена работа Kokoro и Qwen3-TTS, добавлен кодек Nemotron VoiceChat и улучшен стриминг Nemotron ASR.

  • Fixed: Исправлена семантика декодирования в Kokoro и Kitten TTS, устранены ошибки уровня и рассинхронизация F0.
  • Fixed: Устранено нежелательное повышение точности float32 для модели Qwen3-TTS.
  • Added: Добавлена поддержка кодека Nemotron VoiceChat.
  • Added: Улучшена работа потоковой передачи (streaming) для Nemotron ASR.
  • Fixed: Исправлено определение типа модели для Higgs Audio v3 и добавлен высококачественный ресемплер для miniaudio.
v0.4.7minor
🕐 1 мес назад · релиз на GitHub ↗

Релиз v0.4.7: добавлены модели Arktts и Chatterbox Multilingual v3, исправлена громкость по BS.1770 и улучшена работа с потоками.

  • Added: Добавлена поддержка моделей Arktts (DualAR TTS с клонированием голоса) и Chatterbox Multilingual v3.
  • Added: Введена реестровая классификация поддерживаемых аудио-моделей по типу.
  • Fixed: Исправлена ошибка в расчёте интегрированной громкости BS.1770, связанная с калибровочной частотой 997 Гц.
  • Fixed: Устранена проблема с владением потоками сервера MLX при загрузке моделей.
  • Fixed: Оптимизирована обработка кэша: массивы теперь полностью оцениваются перед перемещением потоков.
v0.4.4minor
🕐 3 мес назад · релиз на GitHub ↗

Релиз v0.4.4: поддержка новых моделей (VoxCPM2, MOSS, Mega-ASR), улучшение потоковой генерации и исправление багов.

  • Added: Добавлена поддержка моделей VoxCPM2, MOSS TTS, Mega-ASR, Miso TTS и Silero VAD.
  • Added: Реализована потоковая генерация с перекрытием для Higgs Audio и серверное определение реплик в /v1/realtime.
  • Added: Добавлен эндпоинт GET /v1/audio/voices для обнаружения голосов и поддержка word_timestamps для STT.
  • Fixed: Исправлены регрессии в Fish S2 Pro, Kokoro, VoxCPM2, а также ошибки обработки seed и температурных параметров.
  • Fixed: Улучшена производительность Cohere ASR и устранены зависания AudioPlayer при коротком тексте.