Релиз модели4 августа 2026 г., 08:18 МСК🤖 Auto

DLLM-TTS: Диффузия для TTS с RTF 0.15 и 20к часов обучения

Исследователи представили DLLM-TTS — гибридную модель синтеза речи, сочетающую скорость параллельной генерации с качеством авторегрессионных моделей.

Баннер новости 5016

Проблема компромисса в TTS

Современные системы синтеза речи (TTS) сталкиваются с дилеммой: авторегрессионные модели (AR) обеспечивают высокое качество и разборчивость, но требуют огромных вычислительных ресурсов и генерируют аудио последовательно, что замедляет процесс. Неавторегрессионные подходы быстрее, но часто проигрывают в лингвистической точности и естественности интонации.

Решение: Блочная дискретная диффузия

Команда авторов (Wasim Madha, Nityanand Mathur и др.) предложила архитектуру DLLM-TTS (Block Discrete Diffusion Language Model). Ключевая инновация заключается в том, что задача TTS формулируется как условная блочная дискретная диффузия над токенами нейросетевого аудиокодека X-Codec2.

Модель разбивает последовательности аудио на блоки и применяет маскированную диффузию внутри каждого блока, обрабатывая сами блоки последовательно. Это позволяет модели обучаться как на локальной акустической связности, так и на глобальном выравнивании текста и речи.

Ключевые метрики и характеристики

В результате гибридизации подходов удалось достичь рекордной для данного класса моделей эффективности. Модель имеет 0.6 миллиарда параметров, что делает её относительно легкой, но при этом обучена на 20 000 часов речи, что является скромным объемом для современных LLM, но достаточным для высокой эффективности.

Параметр Значение / Характеристика
Архитектура Блочная дискретная диффузия (Block Discrete Diffusion)
Кодек X-Codec2
Количество параметров 0.6B (600 миллионов)
Объем обучающих данных 20 000 часов
Real-Time Factor (RTF) 0.15 (генерация в 6.6 раз быстрее реального времени)
Бенчмарк Seed-TTS-eval (конкурентные результаты)

Почему это важно

Значение работы DLLM-TTS заключается в демонстрации того, что диффузионные модели могут быть не только «тяжелыми» генераторами изображений или длинных аудиодорожек, но и эффективными инструментами для синтеза речи в реальном времени. Возможность параллельного предсказания токенов внутри блоков при сохранении последовательной обработки блоков между ними позволяет достичь RTF 0.15. Это открывает путь к созданию высококачественных голосовых ассистентов и синтезаторов, работающих на edge-устройствах или в облаке с минимальной задержкой, без необходимости использования гигантских авторегрессионных трансформеров.

Источник: arXiv cs.CL ↗