Архитектура и масштаб данных
AuK (Audio Knowledge) — это фундаментальная модель, объединяющая генерацию и редактирование речи в едином интерфейсе. В основе лежит мультимодальная языковая модель (MLLM) для семантического условного управления, совместный VAE, обученный на речи, музыке и общем аудио, а также гибридный трансформер на базе rectified-flow (Dual-stream MMDiT + Unified DiT).
Масштаб обучения впечатляет: команда собрала около 3.03 миллиарда пар «инструкция-аудио» и использовала 1.95 миллиона часов эффективного супервизии. Данные охватывают пять ключевых семейств задач:
- Генерация речи (Speech Generation)
- Редактирование контента (Content Editing)
- Улучшение и разделение сигналов (Enhancement & Separation)
- Паралингвистическое редактирование (Paralinguistic Editing)
- Акустическое редактирование (Acoustic Editing)
Методы обучения и оптимизация
Процесс обучения разделен на этапы: сначала идет warm-up только на генерации, затем совместное pre-training. Для пост-обучения применены Human-feedback Preference Optimization (для открытого редактирования) и Reward-based Reinforcement Learning (для генерации).
Ключевое достижение — скорость инференса. Благодаря дистилляции с consistency initialization и task-routed Decoupled DMD, версия AuK-Flash способна генерировать речь за 4 шага без classifier-free guidance. Это обеспечивает ускорение в 4.5 раза по сравнению с полной моделью при сохранении качества.
Сравнение с аналогами
AuK демонстрирует лидерские позиции в zero-shot генерации и instruction-controlled задачах. Ниже приведена сводка по ключевым характеристикам модели:
| Параметр | Значение / Характеристика |
|---|---|
| Разработчик | Tencent Hunyuan |
| Тип модели | Фундаментальная модель (Speech Generation & Editing) |
| Объем данных | 3.03 млрд инструкций, 1.95 млн часов аудио |
| Архитектура | MLLM + Joint VAE + Hybrid Rectified-flow Transformer |
| Скорость (AuK-Flash) | 4 шага инференса, ускорение x4.5 |
| Открытый доступ | Да (Weights + Source Code) |
Значение для индустрии
Выпуск AuK знаменует собой сдвиг от узкоспециализированных TTS-систем к универсальным аудио-агентам. Возможность редактировать речь через естественный язык (например, «сделай голос более грустным» или «замени слово X на Y») без переобучения моделей открывает новые возможности для постпродакшена, создания контента и доступности. Исходный код и веса модели уже доступны на Hugging Face, что позволяет исследователям и разработчикам интегрировать эти возможности в свои проекты.
Источник: Huggingface ↗
