Решение проблемы кастинга голосов
Парижская компания Gradium, спин-офф исследовательской лаборатории Kyutai, выпустила функцию Voice Design. Инструмент позволяет генерировать уникальные синтетические голоса на основе текстового промпта (от 1 до 500 символов) без необходимости предоставления эталонной аудиозаписи. Это решает проблему «узкого горлышка» в Voice AI, когда каталог из 400 голосов не покрывает специфические сценарии, такие как «квебекская телефонистка» или «диктор 60 лет с авторитетом».
Генерация работает в реальном времени: пользователь отправляет описание, и система возвращает до 5 вариантов за 3–5 секунд. Поддерживаются английский, французский, испанский, португальский и немецкий языки. Функция доступна бесплатно на всех тарифах Gradium, включая бесплатный tier, как в API, так и в Studio.
Результаты бенчмарков: Gradium против конкурентов
Gradium провела слепое парное прослушивание (blind pairwise listening test) с участием носителей языка. Тестировалось соответствие акцентам в пяти языках. Всего было проведено 7 627 сравнений. Gradium показала результат 72.6% (победы + половина ничьих), что на 13.6 пункта выше главного конкурента — ElevenLabs (59.0%).
Особенно сильно преимущество Gradium проявилось в региональных диалектах, которые часто «сглаживаются» другими моделями:
| Система | Win Rate (Слепое тестирование) | Оценка Gemini 3.1 Pro (1-5) |
|---|---|---|
| Gradium (Voice Design) | 72.6% | 4.06 |
| ElevenLabs (eleven_ttv_v3) | 59.0% | 3.86 |
| Inworld | 44.8% | 3.64 |
| Fish Audio | 36.7% | 3.51 |
| MiniMax | 31.7% | — |
Дополнительно, на наборе данных InstructTTSEval (английская часть) модель показала 83.4% adherence (соблюдение инструкций) к промпту. Важно отметить, что все метрики предоставлены самим вендором.
Техническая реализация и ограничения
Процесс генерации состоит из четырех вызовов API:
POST /voice-generator/generate: создание кандидатов (статусready: false).GET /voice-generator/embeddings: опрос до готовности.- Аудитория через стандартный TTS-эндпоинт с использованием
voice_idкандидата. POST /voices/from-embedding: конвертация выбранного кандидата в постоянный голос.
Генерация является недетерминированной: даже при фиксированном seed результат может отличаться из-за расширения промпта моделью. Несохраненные кандидаты удаляются через 30 дней. Конвертация голоса бесплатна, занимает один слот кастомного голоса (как и клонирование) и делает голос доступным через REST, WebSocket и Speech-to-Speech с той же задержкой, что и каталожные голоса.
Почему это важно
Voice Design устраняет юридические и логистические барьеры, связанные с получением согласия на клонирование голоса. Разработчики могут мгновенно создавать персонализированные голоса для нишевых задач (например, локализация контента под специфические диалекты) без поиска дикторов и обработки прав. Это переводит кастинг голосов из ручного процесса в автоматизированный API-вызов.
Источник: MarkTechPost ↗
