Релиз модели10 сентября 2026 г., 11:46 МСК🤖 Auto

Tencent Hunyuan AuK: Новый стандарт голосового клонирования

Tencent представила модель AuK, способную с высокой точностью имитировать сложные эмоциональные состояния и тембральные особенности речи, включая специфические интонации исторических личностей.

Баннер новости 7159

Технология точного контроля голоса

Компания Tencent через платформу GitHub представила проект AuK (часть экосистемы Hunyuan). В отличие от стандартных систем синтеза речи, AuK фокусируется на инструктивном управлении голосом. Модель позволяет пользователю задавать не просто тембр, но и психологический портрет говорящего через текстовые промпты, описывающие характер, возраст, эмоциональное состояние и ритмику речи.

Демонстрация на примере Цао Цао

Ключевым примером работы модели служит задача озвучивания знаменитой фразы Цао Цао: «Нин ко вэй тянься рэнь, сюй цзяо тянься рэнь фу вэй» (Лучше я предам весь мир, чем мир предаст меня). Система требует от модели не просто прочитать текст, а воспроизвести его в строго заданном стиле:

  • Характер: «Лидер в хаотичные времена, сложный характер».
  • Тембр: «Средний мужской голос, слегка хриплый, но с высокой проникающей силой».
  • Интонация: «Уверенная, решительная, с оттенком подозрительности и проницательности».
  • Динамика: «Четкое изменение темпа: от тихого, медленного нагнетания к резкому усилению на ключевых словах».

Технические особенности

Модель демонстрирует способность обрабатывать длинные и детализированные описания стиля (voice profiles). Это позволяет создавать аудиоконтент, где голос становится инструментом нарратива, а не просто средством передачи текста. Архитектура позволяет сохранять естественность переходов между разными эмоциональными состояниями в рамках одного высказывания.

Значение для индустрии

Публикация кода и моделей на GitHub открывает путь для разработчиков, создающих интерактивные истории, видеоигры и персонализированных ассистентов. AuK снижает порог входа для создания «живого» голоса, требуя от пользователя лишь грамотного описания желаемого результата, а не сложной настройки параметров синтеза.

Источник: Github ↗