Релиз модели1 сентября 2026 г., 19:49 МСК🤖 Auto

ICE-012 Audio: 590 языков, клонирование голоса и стриминг

DarkPs выпустил мультязычную TTS-модель с поддержкой 590 языков, активным акустическим адаптером и клонированием голоса по референсу. Лицензия Apache-2.0.

Баннер новости 6516

Новая архитектура: Активный акустический адаптер

Модель ICE-012 Audio от разработчика DarkPs представляет собой не просто еще одну TTS-систему, а архитектуру с внедренным активным акустическим адаптером. Эта инновация заключается в двух ключевых этапах обработки: кодирование эмбеддингов кодека происходит до основной сети (backbone), а скрытые состояния (hidden states) уточняются после нее. Такой подход позволяет значительно улучшить качество синтеза и стабильность голоса при стриминге.

Модель поддерживает стриминговый вывод (streaming output), что критически важно для приложений реального времени, таких как голосовые помощники или интерактивные диалоговые системы. Лицензия Apache-2.0 делает модель открытой для коммерческого использования.

Масштаб поддержки языков

Главная особенность ICE-012 — экстремально широкая языковая поддержка. Модель обучена на 590 названиях и вариантах языков. Это включает не только крупные мировые языки, но и множество диалектов арабского, африканских языков и редких европейских диалектов. Для удобства используются как полные названия, так и 2-3 буквенные коды (ISO).

Гибкое управление голосом и клонирование

Разработчики внедрили систему тонкой настройки голоса через параметры CLI. Пользователь может контролировать пол, возраст, высоту тона, акцент, стиль и скорость. Также доступна функция voice cloning на основе референсного аудиофайла.

Параметр Доступные значения / Примеры Описание
Gender male, female Пол синтезируемого голоса
Age child, teenager, young adult, middle-aged, elderly Возрастная категория
Pitch very low pitch, low pitch, moderate pitch, high pitch, very high pitch Высота тона
Accent american, british, russian, chinese, japanese и др. Региональный акцент
Style whisper, young adult, elderly, low pitch Стиль речи (комбинируется с другими параметрами)
Speed 0.5, 1.0 (default), 1.5, 2.0 Множитель скорости речи

Примеры использования (CLI)

Модель интегрируется через библиотеку transformers. Ниже приведены примеры команд для синтеза речи и клонирования голоса:

  • Стриминговый TTS: python 02_stream_tts.py --language "arabic" --gender female --style "young adult" --speed 1.0 --output out.wav
  • Чтение из файла: python 02_stream_tts.py --text-file input.txt --language "en" --gender male --style "elderly, low pitch"
  • Клонирование голоса: python 03_stream_voice_clone.py --reference ref.wav --output clone.wav

Для улучшения качества клонирования рекомендуется предоставлять транскрипт референсного аудио через флаг --reference-text. Модель автоматически выбирает голос, если не задан конкретный референс, или использует его, если он предоставлен.

Источник: Huggingface ↗