Релиз модели13 сентября 2026 г., 21:46 МСК🤖 Auto

Tencent AuK: Универсальная модель генерации и редактирования голоса

Tencent Hunyuan представила AuK — открытую фундаментальную модель для синтеза и редактирования речи через текстовые инструкции. Модель обучена на 3 млрд примеров и 1.95 млн часов аудио, обеспечивая лидерские результаты в zero-shot задачах.

Баннер новости 7408

Архитектура и масштаб данных

AuK (Audio Knowledge) — это фундаментальная модель, объединяющая генерацию и редактирование речи в едином интерфейсе. В основе лежит мультимодальная языковая модель (MLLM) для семантического условного управления, совместный VAE, обученный на речи, музыке и общем аудио, а также гибридный трансформер на базе rectified-flow (Dual-stream MMDiT + Unified DiT).

Масштаб обучения впечатляет: команда собрала около 3.03 миллиарда пар «инструкция-аудио» и использовала 1.95 миллиона часов эффективного супервизии. Данные охватывают пять ключевых семейств задач:

  • Генерация речи (Speech Generation)
  • Редактирование контента (Content Editing)
  • Улучшение и разделение сигналов (Enhancement & Separation)
  • Паралингвистическое редактирование (Paralinguistic Editing)
  • Акустическое редактирование (Acoustic Editing)

Методы обучения и оптимизация

Процесс обучения разделен на этапы: сначала идет warm-up только на генерации, затем совместное pre-training. Для пост-обучения применены Human-feedback Preference Optimization (для открытого редактирования) и Reward-based Reinforcement Learning (для генерации).

Ключевое достижение — скорость инференса. Благодаря дистилляции с consistency initialization и task-routed Decoupled DMD, версия AuK-Flash способна генерировать речь за 4 шага без classifier-free guidance. Это обеспечивает ускорение в 4.5 раза по сравнению с полной моделью при сохранении качества.

Сравнение с аналогами

AuK демонстрирует лидерские позиции в zero-shot генерации и instruction-controlled задачах. Ниже приведена сводка по ключевым характеристикам модели:

Параметр Значение / Характеристика
Разработчик Tencent Hunyuan
Тип модели Фундаментальная модель (Speech Generation & Editing)
Объем данных 3.03 млрд инструкций, 1.95 млн часов аудио
Архитектура MLLM + Joint VAE + Hybrid Rectified-flow Transformer
Скорость (AuK-Flash) 4 шага инференса, ускорение x4.5
Открытый доступ Да (Weights + Source Code)

Значение для индустрии

Выпуск AuK знаменует собой сдвиг от узкоспециализированных TTS-систем к универсальным аудио-агентам. Возможность редактировать речь через естественный язык (например, «сделай голос более грустным» или «замени слово X на Y») без переобучения моделей открывает новые возможности для постпродакшена, создания контента и доступности. Исходный код и веса модели уже доступны на Hugging Face, что позволяет исследователям и разработчикам интегрировать эти возможности в свои проекты.

Источник: Huggingface ↗