Инструменты9 сентября 2026 г., 11:19 МСК🤖 Auto

Gradium Voice Design: Генерация голосов по тексту без референсов

Gradium представила Voice Design — API-инструмент, создающий новые синтетические голоса за 3–5 секунд по текстовому описанию. В слепых тестах система превзошла ElevenLabs и Inworld, особенно в региональных акцентах.

Баннер новости 7071

Решение проблемы кастинга голосов

Парижская компания Gradium, спин-офф исследовательской лаборатории Kyutai, выпустила функцию Voice Design. Инструмент позволяет генерировать уникальные синтетические голоса на основе текстового промпта (от 1 до 500 символов) без необходимости предоставления эталонной аудиозаписи. Это решает проблему «узкого горлышка» в Voice AI, когда каталог из 400 голосов не покрывает специфические сценарии, такие как «квебекская телефонистка» или «диктор 60 лет с авторитетом».

Генерация работает в реальном времени: пользователь отправляет описание, и система возвращает до 5 вариантов за 3–5 секунд. Поддерживаются английский, французский, испанский, португальский и немецкий языки. Функция доступна бесплатно на всех тарифах Gradium, включая бесплатный tier, как в API, так и в Studio.

Результаты бенчмарков: Gradium против конкурентов

Gradium провела слепое парное прослушивание (blind pairwise listening test) с участием носителей языка. Тестировалось соответствие акцентам в пяти языках. Всего было проведено 7 627 сравнений. Gradium показала результат 72.6% (победы + половина ничьих), что на 13.6 пункта выше главного конкурента — ElevenLabs (59.0%).

Особенно сильно преимущество Gradium проявилось в региональных диалектах, которые часто «сглаживаются» другими моделями:

Система Win Rate (Слепое тестирование) Оценка Gemini 3.1 Pro (1-5)
Gradium (Voice Design) 72.6% 4.06
ElevenLabs (eleven_ttv_v3) 59.0% 3.86
Inworld 44.8% 3.64
Fish Audio 36.7% 3.51
MiniMax 31.7%

Дополнительно, на наборе данных InstructTTSEval (английская часть) модель показала 83.4% adherence (соблюдение инструкций) к промпту. Важно отметить, что все метрики предоставлены самим вендором.

Техническая реализация и ограничения

Процесс генерации состоит из четырех вызовов API:

  1. POST /voice-generator/generate: создание кандидатов (статус ready: false).
  2. GET /voice-generator/embeddings: опрос до готовности.
  3. Аудитория через стандартный TTS-эндпоинт с использованием voice_id кандидата.
  4. POST /voices/from-embedding: конвертация выбранного кандидата в постоянный голос.

Генерация является недетерминированной: даже при фиксированном seed результат может отличаться из-за расширения промпта моделью. Несохраненные кандидаты удаляются через 30 дней. Конвертация голоса бесплатна, занимает один слот кастомного голоса (как и клонирование) и делает голос доступным через REST, WebSocket и Speech-to-Speech с той же задержкой, что и каталожные голоса.

Почему это важно

Voice Design устраняет юридические и логистические барьеры, связанные с получением согласия на клонирование голоса. Разработчики могут мгновенно создавать персонализированные голоса для нишевых задач (например, локализация контента под специфические диалекты) без поиска дикторов и обработки прав. Это переводит кастинг голосов из ручного процесса в автоматизированный API-вызов.

Источник: MarkTechPost ↗