supertone-inc/supertonic

Молниеносное многоязычное TTS на устройстве, работающее нативно через ONNX.

Аудио⭐ 13 788Swiftпоследний релиз: v2.0.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Supertonic — это легковесная система синтеза речи (TTS) с открытым весом, работающая полностью на устройстве пользователя через ONNX без необходимости подключения к облаку.

Зачем нужен

Инструмент решает задачу генерации высококачественной речи с низкой задержкой в локальной среде, обеспечивая полную конфиденциальность данных. Он полезен для создания приложений, где критичны скорость отклика, отсутствие сетевых зависимостей и работа на ресурсоограниченных устройствах.

Что можно реализовать

  • Локальная озвучка веб-страниц или контента в реальном времени с задержкой менее секунды
  • Создание голосовых ассистентов и приложений для мобильных устройств и IoT (например, Raspberry Pi) без GPU
  • Генерация аудио с естественными интонациями (смех, вздохи) с помощью встроенных тегов выражения
  • Использование в качестве локального HTTP-сервера с OpenAI-совместимым API для интеграции в существующие пайплайны

Ключевые возможности

  • Поддержка 31 языка и режим language-agnostic (lang='na') для автоматического определения языка
  • Модель всего 99M параметров, работающая без GPU и интернета
  • Выходной сигнал 44.1kHz 16-bit WAV, готовый к продакшену
  • Кроссплатформенный SDK: Python, Node.js, WebGPU, Java, C++, Go, Swift, iOS, Rust, Flutter
  • Встроенные теги для управления эмоциями и паузами (<laugh>, <breath>, <sigh>)

👤 Кому подойдёт: разработчики, создающие офлайн-приложения, энтузиасты локального AI, разработчики мобильных и embedded-решений

Релизы