Tencent-Hunyuan/AuK

AuK: Открытая базовая модель для генерации и редактирования речи

Аудио⭐ 1 450Python
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

AuK — это открытая фундаментальная модель генерации и редактирования речи объемом 1.5B параметров, позволяющая управлять аудио через текстовые инструкции.

Зачем нужен

Инструмент решает задачу синтеза и постобработки звука в едином интерфейсе, исключая необходимость использовать разные модели для TTS, шумоподавления или изменения текста. Он полезен для создания реалистичных голосов, быстрой генерации контента и точечного редактирования аудиодорожек без переписывания всего файла.

Что можно реализовать

  • Zero-shot TTS: генерация речи на заданный текст голосом из референсного аудиофайла.
  • Instruct TTS: создание речи по текстовому описанию голоса без необходимости наличия референса.
  • Content Editing: замена, вставка или удаление слов в существующей аудиозаписи с сохранением интонации.
  • Speech Enhancement: улучшение качества звука и удаление шумов из аудиодорожки.
  • Source Separation: разделение смешанного аудио на отдельные источники (например, голос и музыка).

Ключевые возможности

  • Единый интерфейс на естественном языке для всех задач (генерация, редактирование, улучшение, сепарация).
  • Два варианта модели: базовая AuK для качества и AuK-Flash (дистиллированная) для быстрого вывода за 4 шага.
  • Поддержка локального инференса на потребительских GPU (снижение потребления памяти на ~7.5 GiB) и Apple Silicon (через MLX).
  • Открытый исходный код и веса, доступные на Hugging Face и ModelScope.
  • Интеграция с популярными инструментами, такими как ComfyUI и SGLang-Omni.

👤 Кому подойдёт: разработчики, исследователи в области аудио AI, создатели контента, нуждающиеся в гибком инструменте для синтеза и редактирования речи.

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.