Supertonic — это легковесная система синтеза речи (TTS) с открытым весом, работающая полностью на устройстве пользователя через ONNX без необходимости подключения к облаку.
Зачем нужен
Инструмент решает задачу генерации высококачественной речи с низкой задержкой в локальной среде, обеспечивая полную конфиденциальность данных. Он полезен для создания приложений, где критичны скорость отклика, отсутствие сетевых зависимостей и работа на ресурсоограниченных устройствах.
Что можно реализовать
Локальная озвучка веб-страниц или контента в реальном времени с задержкой менее секунды
Создание голосовых ассистентов и приложений для мобильных устройств и IoT (например, Raspberry Pi) без GPU
Генерация аудио с естественными интонациями (смех, вздохи) с помощью встроенных тегов выражения
Использование в качестве локального HTTP-сервера с OpenAI-совместимым API для интеграции в существующие пайплайны
Ключевые возможности
Поддержка 31 языка и режим language-agnostic (lang='na') для автоматического определения языка
Модель всего 99M параметров, работающая без GPU и интернета
Выходной сигнал 44.1kHz 16-bit WAV, готовый к продакшену