Google представила две новые модели синтеза речи (TTS) в семействе Gemini Audio: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Это самые выразительные аудио-модели компании на данный момент. Ключевое отличие — возможность режиссуры озвучки «по строкам» с помощью естественного языка, что позволяет детально управлять интонацией, паузами и эмоциями персонажей.
01Две модели для разных задач
Google разделила линейку на два уровня производительности и стоимости:
- Gemini 3.8 Flash TTS: Ориентирована на креативные задачи, создание персонажей для игр, аудиокниг и подкастов. Предлагает глубокий контроль над актерской игрой, диалектами и бэк-каналингом (реакциями слушателя).
- Gemini 3.8 Flash-Lite TTS: Оптимизирована для массового производства, дубляжа и голосовых агентов. Фокус на высокой скорости и низкой стоимости при сохранении выразительности.
02Генерация голосов и библиотека
В отличие от предыдущих версий с 30 базовыми голосами, новая архитектура предлагает масштабный выбор:
- Generative Voice Design: Создание новых голосов по текстовому описанию (роль, акцент, характеристики). Поддерживается более 100 языков и диалектов. Примеры из демо: диджей из Мельбурна, монотонный робот, японский дракон.
- Библиотека голосов: Более 2000 готовых к продакшену голосов, включая региональные вариации (мексиканский испанский, квебекский французский, шотландский английский).
- Сохранение и масштабирование: Пользовательские голоса можно сохранять и переиспользовать с минимальным дрейфом качества между проектами.
03Режиссура и технические возможности
Модели принимают сценарные указания, написанные в тексте. Это позволяет управлять производительностью строка за строкой.
- Долгое формирование: Качество голоса, темп и тембр сохраняются на протяжении часов непрерывного аудио.
- Нативная постановка двух говорящих: Один скрипт может управлять многооборотным диалогом с разными голосами.
- Вокальные эффекты: Поддержка невербальных маркеров, таких как
<laughs>,<sigh>,<gasp>. - Бэк-каналинг: Вставка реакций слушателя, например,
|mhm|или|yeah|, для контроля ритма и комедийного тайминга.
04Бенчмарки и качество
Google публикует следующие результаты тестирования:
- Hume AI Voice Design Benchmark: Flash TTS занимает 1-е место с оценкой 71.4.
- Accent modeling: Flash TTS лидирует с оценкой 60.8.
- Hume AI Overall Quality Index: Flash TTS — 1-е место, Flash-Lite — 2-е место.
- Voice Arena (blind preference): Обе модели занимают топ-позиции в японском, бразильском португальском, вьетнамском, современном арабском, мексиканском испанском и хинди.
05Безопасность и маркировка
Каждый сгенерированный аудиоклип содержит невидимый водяной знак SynthID, встроенный непосредственно в аудио. Голоса, созданные с помощью репликации, также имеют учетные данные контента C2PA. Это часть более широкой стратегии безопасности Gemini 3.8 Audio.
06Кому подойдёт / что запустится
Решение идеально подходит для:
- Разработчиков игр и интерактивных медиа, нуждающихся в глубокой кастомизации персонажей.
- Студий дубляжа и создания аудиоконтента, требующих высокой скорости и низкой стоимости (Flash-Lite).
- Разработчиков голосовых агентов, которым важна естественность и реакция в реальном времени.
Для запуска используйте идентификаторы моделей в Gemini API:
# Пример использования в коде (псевдокод для Gemini API)
model_id = "gemini-3.8-flash-tts" # Для креативных задач
model_id = "gemini-3.8-flash-lite-tts" # Для массового производстваЛокально развернуть модели невозможно из-за отсутствия открытых весов. Доступ осуществляется исключительно через облачные API Google.
Источник: MarkTechPost ↗
