argmaxinc/argmax-oss-swift

Локальный речевой ИИ для Apple Silicon

Аудио⭐ 6 373Swiftпоследний релиз: v1.1.0
Открыть на GitHub ↗

Что это за инструмент

Argmax Open-Source SDK — это набор Swift-библиотек для запуска моделей искусственного интеллекта (распознавание речи, синтез речи, идентификация говорящих) непосредственно на устройствах Apple Silicon.

Зачем нужен

Инструмент позволяет разработчикам интегрировать on-device AI-функции в приложения без необходимости отправки данных на внешние серверы, что обеспечивает конфиденциальность и работу офлайн. Он упрощает использование моделей Whisper, Pyannote и Qwen-TTS через нативный Swift API.

Что можно реализовать

  • Локальное распознавание речи (speech-to-text) в мобильных или десктопных приложениях для macOS/iOS
  • Синтез речи (text-to-speech) с использованием моделей Qwen-TTS прямо на устройстве
  • Диааризация аудио (разделение говорящих) с помощью модели Pyannote
  • Запуск локального HTTP-сервера для обработки аудио-запросов от других приложений
  • Создание голосовых помощников с приватностью данных, не требующих интернета

Ключевые возможности

  • Поддержка трех ключевых модулей: WhisperKit (STT), SpeakerKit (diarization), TTSKit (TTS)
  • Работа полностью on-device на Apple Silicon (macOS 14.0+, Xcode 16.0+)
  • Удобная установка через Swift Package Manager (SPM) и Homebrew
  • Встроенный Swift CLI для тестирования и локальный сервер с API
  • Открытая лицензия с возможностью перехода на Pro SDK для расширенных функций

👤 Кому подойдёт: Разработчики приложений для экосистемы Apple (iOS, macOS), использующие Swift, которым нужны приватные и быстрые AI-функции обработки аудио без зависимости от облачных API.

Релизы

v1.1.0majorbreaking
🕐 1 мес назад · релиз на GitHub ↗

WhisperKit: экономия памяти через инкрементальную загрузку. TTSKit: ускорение Qwen3-TTS. SpeakerKit: центроиды спикеров. Ломающие изменения для TTSKit.

  • Added: WhisperKit: инкрементальная загрузка аудио снижает пиковое потребление памяти более чем на 70% для длинных файлов.
  • Added: TTSKit: ускорение Qwen3-TTS на ~40% благодаря новым режимам декодирования SpeechDecoder и MultiCodeDecoder.
  • Added: SpeakerKit: добавлены центроидные эмбеддинги спикеров для сопоставления голосов между разными запусками диаризации.
  • Fixed: Исправлены ошибки в подсчете promptTokens, таймкодах для китайского языка, границах чанков TTS и путях кэширования моделей.
  • Breaking: TTSKit теперь требует macOS 15 / iOS 18; изменены модели по умолчанию, требуется однократная загрузка новых активов.
v1.0.0majorbreaking
🕐 4 мес назад · релиз на GitHub ↗

Релиз v1.0.0: переименование в Argmax Open-Source SDK, полная поддержка Swift 6 и удаление устаревших API.

  • Added: Проект переименован в Argmax Open-Source SDK, объединяющий WhisperKit, SpeakerKit, TTSKit и ArgmaxCore.
  • Added: Добавлена полная поддержка многопоточности Swift 6 и динамическая библиотека для бинарной дистрибуции.
  • Added: Исходные коды Hub и Tokenizers из swift-transformers включены в состав SDK для независимой сборки.
  • Added: Обновленный CLI argmax-cli поддерживает локальный сервер с OpenAI-совместимым API для транскрипции.
  • Breaking: Удалены все устаревшие API, включая старые сигнатуры методов транскрипции и глобальные функции.