Технология точного контроля голоса
Компания Tencent через платформу GitHub представила проект AuK (часть экосистемы Hunyuan). В отличие от стандартных систем синтеза речи, AuK фокусируется на инструктивном управлении голосом. Модель позволяет пользователю задавать не просто тембр, но и психологический портрет говорящего через текстовые промпты, описывающие характер, возраст, эмоциональное состояние и ритмику речи.
Демонстрация на примере Цао Цао
Ключевым примером работы модели служит задача озвучивания знаменитой фразы Цао Цао: «Нин ко вэй тянься рэнь, сюй цзяо тянься рэнь фу вэй» (Лучше я предам весь мир, чем мир предаст меня). Система требует от модели не просто прочитать текст, а воспроизвести его в строго заданном стиле:
- Характер: «Лидер в хаотичные времена, сложный характер».
- Тембр: «Средний мужской голос, слегка хриплый, но с высокой проникающей силой».
- Интонация: «Уверенная, решительная, с оттенком подозрительности и проницательности».
- Динамика: «Четкое изменение темпа: от тихого, медленного нагнетания к резкому усилению на ключевых словах».
Технические особенности
Модель демонстрирует способность обрабатывать длинные и детализированные описания стиля (voice profiles). Это позволяет создавать аудиоконтент, где голос становится инструментом нарратива, а не просто средством передачи текста. Архитектура позволяет сохранять естественность переходов между разными эмоциональными состояниями в рамках одного высказывания.
Значение для индустрии
Публикация кода и моделей на GitHub открывает путь для разработчиков, создающих интерактивные истории, видеоигры и персонализированных ассистентов. AuK снижает порог входа для создания «живого» голоса, требуя от пользователя лишь грамотного описания желаемого результата, а не сложной настройки параметров синтеза.
Источник: Github ↗
