Ключевые особенности и производительность
TeraTTSv2 — это самодостаточная модель синтеза речи (TTS), упакованная в формат ONNX Runtime. Главная инновация для русскоязычных пользователей — встроенная автоматическая расстановка ударений. Система использует адаптацию библиотеки RUAccent, что позволяет избежать ошибок произношения, типичных для базовых TTS-моделей. Модель поддерживает два режима работы: быстрый дистиллированный студент (8 шагов) и более точный, но медленный учитель (teacher model) с настраиваемым CFG.
Технические характеристики и управление
Модель работает с аудио частотой 44,100 Гц, выдавая результат в виде моно-массива float32. Для генерации не требуется сторонних аудио-библиотек, достаточно стандартных Python-пакетов. Ниже приведена таблица основных параметров управления:
| Параметр | Значения | Эффект |
|---|---|---|
| voice | ru_f1★, ru_m5★, eng_f3 и др. (всего 10) | Выбор стиля голоса. ★ — рекомендованные для русского языка. |
| diffusion_model | distilled (по умолч.), teacher | distilled — быстрый 8-шаговый самплер; teacher — поддержка настраиваемого CFG. |
| ruaccent_mode | full (по умолч.), dictionary | full — нейросетевые графы RUAccent + словари; dictionary — только словари (меньше памяти). |
| duration_scale | Положительное число (по умолч. 1.0) | Управление скоростью: выше значение — медленнее речь. |
Работа с языками и стресс-маркерами
Система требует явного указания языка через теги
Для кросс-языковых промптов (например, английский голос произносит русский текст) рекомендуется использовать параметр duration_scale=0.8 для лучшей синхронизации темпа.
Пример интеграции
Загрузка модели и генерация аудио занимают минимум ресурсов благодаря ONNX Runtime. Пример кода на Python:
- Установка:
pip install -r requirements.txt - Загрузка:
tts = AutoModel.from_pretrained("TeraSpace/TeraTTSv2", trust_remote_code=True, provider="CPUExecutionProvider") - Генерация:
waveform = tts.generate_speech("Привет от TeraTTS. ", voice="ru_f1")
Модель также поддерживает потоковую генерацию аудио через generate_speech_stream, что удобно для интеграции в голосовые помощники и чат-боты в реальном времени.
Статистика и доступность
За последний месяц модель скачали 1,723 раза, что свидетельствует о растущем интересе разработчиков к легковесным решениям для синтеза речи. Модель доступна на Hugging Face под лицензией, совместимой с MIT (для компонента RUAccent).
Источник: Huggingface ↗
