Новая архитектура: Активный акустический адаптер
Модель ICE-012 Audio от разработчика DarkPs представляет собой не просто еще одну TTS-систему, а архитектуру с внедренным активным акустическим адаптером. Эта инновация заключается в двух ключевых этапах обработки: кодирование эмбеддингов кодека происходит до основной сети (backbone), а скрытые состояния (hidden states) уточняются после нее. Такой подход позволяет значительно улучшить качество синтеза и стабильность голоса при стриминге.
Модель поддерживает стриминговый вывод (streaming output), что критически важно для приложений реального времени, таких как голосовые помощники или интерактивные диалоговые системы. Лицензия Apache-2.0 делает модель открытой для коммерческого использования.
Масштаб поддержки языков
Главная особенность ICE-012 — экстремально широкая языковая поддержка. Модель обучена на 590 названиях и вариантах языков. Это включает не только крупные мировые языки, но и множество диалектов арабского, африканских языков и редких европейских диалектов. Для удобства используются как полные названия, так и 2-3 буквенные коды (ISO).
Гибкое управление голосом и клонирование
Разработчики внедрили систему тонкой настройки голоса через параметры CLI. Пользователь может контролировать пол, возраст, высоту тона, акцент, стиль и скорость. Также доступна функция voice cloning на основе референсного аудиофайла.
| Параметр | Доступные значения / Примеры | Описание |
|---|---|---|
| Gender | male, female | Пол синтезируемого голоса |
| Age | child, teenager, young adult, middle-aged, elderly | Возрастная категория |
| Pitch | very low pitch, low pitch, moderate pitch, high pitch, very high pitch | Высота тона |
| Accent | american, british, russian, chinese, japanese и др. | Региональный акцент |
| Style | whisper, young adult, elderly, low pitch | Стиль речи (комбинируется с другими параметрами) |
| Speed | 0.5, 1.0 (default), 1.5, 2.0 | Множитель скорости речи |
Примеры использования (CLI)
Модель интегрируется через библиотеку transformers. Ниже приведены примеры команд для синтеза речи и клонирования голоса:
- Стриминговый TTS:
python 02_stream_tts.py --language "arabic" --gender female --style "young adult" --speed 1.0 --output out.wav - Чтение из файла:
python 02_stream_tts.py --text-file input.txt --language "en" --gender male --style "elderly, low pitch" - Клонирование голоса:
python 03_stream_voice_clone.py --reference ref.wav --output clone.wav
Для улучшения качества клонирования рекомендуется предоставлять транскрипт референсного аудио через флаг --reference-text. Модель автоматически выбирает голос, если не задан конкретный референс, или использует его, если он предоставлен.
Источник: Huggingface ↗
