Релиз модели17 августа 2026 г., 15:45 МСК🤖 Auto

TeraTTSv2: Быстрый TTS с авто-ударениями и поддержкой ONNX

TeraSpace представила TeraTTSv2 — оптимизированную модель синтеза речи в формате ONNX с автоматической расстановкой ударений в русском языке, 10 голосами и потоковой генерацией.

Баннер новости 5921

Ключевые особенности и производительность

TeraTTSv2 — это самодостаточная модель синтеза речи (TTS), упакованная в формат ONNX Runtime. Главная инновация для русскоязычных пользователей — встроенная автоматическая расстановка ударений. Система использует адаптацию библиотеки RUAccent, что позволяет избежать ошибок произношения, типичных для базовых TTS-моделей. Модель поддерживает два режима работы: быстрый дистиллированный студент (8 шагов) и более точный, но медленный учитель (teacher model) с настраиваемым CFG.

Технические характеристики и управление

Модель работает с аудио частотой 44,100 Гц, выдавая результат в виде моно-массива float32. Для генерации не требуется сторонних аудио-библиотек, достаточно стандартных Python-пакетов. Ниже приведена таблица основных параметров управления:

Параметр Значения Эффект
voice ru_f1★, ru_m5★, eng_f3 и др. (всего 10) Выбор стиля голоса. ★ — рекомендованные для русского языка.
diffusion_model distilled (по умолч.), teacher distilled — быстрый 8-шаговый самплер; teacher — поддержка настраиваемого CFG.
ruaccent_mode full (по умолч.), dictionary full — нейросетевые графы RUAccent + словари; dictionary — только словари (меньше памяти).
duration_scale Положительное число (по умолч. 1.0) Управление скоростью: выше значение — медленнее речь.

Работа с языками и стресс-маркерами

Система требует явного указания языка через теги ... или .... Текст внутри тегов автоматически размечается ударениями. Явные маркеры ударений в тексте всегда имеют приоритет над автоматическими. Числа внутри языковых тегов автоматически расширяются в слова на соответствующем языке (например, «21» превращается в «двадцать одно» для русского текста).

Для кросс-языковых промптов (например, английский голос произносит русский текст) рекомендуется использовать параметр duration_scale=0.8 для лучшей синхронизации темпа.

Пример интеграции

Загрузка модели и генерация аудио занимают минимум ресурсов благодаря ONNX Runtime. Пример кода на Python:

  • Установка: pip install -r requirements.txt
  • Загрузка: tts = AutoModel.from_pretrained("TeraSpace/TeraTTSv2", trust_remote_code=True, provider="CPUExecutionProvider")
  • Генерация: waveform = tts.generate_speech("Привет от TeraTTS.", voice="ru_f1")

Модель также поддерживает потоковую генерацию аудио через generate_speech_stream, что удобно для интеграции в голосовые помощники и чат-боты в реальном времени.

Статистика и доступность

За последний месяц модель скачали 1,723 раза, что свидетельствует о растущем интересе разработчиков к легковесным решениям для синтеза речи. Модель доступна на Hugging Face под лицензией, совместимой с MIT (для компонента RUAccent).

Источник: Huggingface ↗