Tencent-Hunyuan/AuK
AuK: Открытая базовая модель для генерации и редактирования речи
Аудио⭐ 1 450Python
Что это за инструмент
AuK — это открытая фундаментальная модель генерации и редактирования речи объемом 1.5B параметров, позволяющая управлять аудио через текстовые инструкции.
Зачем нужен
Инструмент решает задачу синтеза и постобработки звука в едином интерфейсе, исключая необходимость использовать разные модели для TTS, шумоподавления или изменения текста. Он полезен для создания реалистичных голосов, быстрой генерации контента и точечного редактирования аудиодорожек без переписывания всего файла.
Что можно реализовать
- Zero-shot TTS: генерация речи на заданный текст голосом из референсного аудиофайла.
- Instruct TTS: создание речи по текстовому описанию голоса без необходимости наличия референса.
- Content Editing: замена, вставка или удаление слов в существующей аудиозаписи с сохранением интонации.
- Speech Enhancement: улучшение качества звука и удаление шумов из аудиодорожки.
- Source Separation: разделение смешанного аудио на отдельные источники (например, голос и музыка).
Ключевые возможности
- Единый интерфейс на естественном языке для всех задач (генерация, редактирование, улучшение, сепарация).
- Два варианта модели: базовая AuK для качества и AuK-Flash (дистиллированная) для быстрого вывода за 4 шага.
- Поддержка локального инференса на потребительских GPU (снижение потребления памяти на ~7.5 GiB) и Apple Silicon (через MLX).
- Открытый исходный код и веса, доступные на Hugging Face и ModelScope.
- Интеграция с популярными инструментами, такими как ComfyUI и SGLang-Omni.
👤 Кому подойдёт: разработчики, исследователи в области аудио AI, создатели контента, нуждающиеся в гибком инструменте для синтеза и редактирования речи.
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.