Два уровня производительности для разных задач
Google расширила семейство Gemini Audio двумя новыми моделями синтеза речи (TTS), разделив их на два целевых сегмента. Gemini 3.8 Flash TTS ориентирована на креативные индустрии: создание персонажей для игр, аудиокниг и подкастов. Модель позволяет детально управлять актерской игрой, темпом, диалектами и реакциями слушателя. Gemini 3.8 Flash-Lite TTS позиционируется как решение для высоконагруженных и экономичных задач, таких как дубляж и голосовые агенты, сохраняя при этом высокую выразительность.
От 30 к 2000+: революция в библиотеке голосов
Ключевое отличие версии 3.8 — масштаб. Если предыдущие поколения предлагали лишь 30 оригинальных голосов, то теперь разработчикам доступно более 2000 готовых к продакшену голосов, включая региональные вариации (мексиканский испанский, квебекский французский, шотландский английский). Кроме того, Flash TTS поддерживает генеративный дизайн голосов: по текстовому описанию роли, акцента и характеристик можно создать уникальный голос на более чем 100 языках. Также скоро появится функция «ремикса» голосов через промпты.
Техническое управление и безопасность
Модели поддерживают репликацию голоса по 30-секундному образцу, но требуют обязательной записи согласия владельца. Все сгенерированные аудио содержат невидимый водяной знак SynthID и метаданные C2PA. Управление подачей осуществляется через текстовые инструкции в сценарии: можно задавать паузы, смех, вздохи (
Результаты бенчмарков
Google сообщает о лидерских позициях новых моделей в независимых тестах. Gemini 3.8 Flash TTS заняла первое место в Hume AI Voice Design Benchmark с результатом 71.4, а Flash-Lite стала второй в общем индексе качества. В слепом тестировании Voice Arena обе модели показали лучшие предпочтения пользователей в японском, бразильском португальском, вьетнамском, арабском, мексиканском испанском и хинди.
| Метрика / Модель | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS |
|---|---|---|
| Основное назначение | Креатив, персонажи, игры | Массовый дубляж, голосовые агенты |
| Библиотека голосов | 2000+ готовых + генерация по промпту | |
| Hume AI Voice Design Benchmark | #1 (71.4 балла) | Информация недостаточна |
| Hume AI Overall Quality Index | #1 | #2 |
| Доступность | Gemini API, Google AI Studio (API-only) | |
Где и как использовать
Модели уже доступны через Gemini API и Google AI Studio под идентификаторами gemini-3.8-flash-tts и gemini-3.8-flash-lite-tts. Открытых весов для самостоятельного хостинга нет. Доступ через Gemini Enterprise для корпоративных клиентов ожидается в ближайшее время. Репликация голосов временно недоступна в ряде регионов, включая Великобританию, ЕЭЗ и Индию.
Источник: MarkTechPost ↗
