Два новых уровня производительности
Google анонсировала две новые модели синтеза речи в семействе Gemini: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Первая ориентирована на глубокое творческое направление и создание персонажей, вторая — на массовое масштабирование, дубляж и голосовых агентов с высокой эффективностью.
Модели доступны через Google AI Studio, Gemini API, Gemini Enterprise и интегрированы в продукты вроде Gemini Notebook и Google Vids. Это следующий шаг после Gemini 3.5 Live Translate и 3.8 Live, расширяющий возможности аудио-генерации.
Лидерство в бенчмарках и языках
Новые модели демонстрируют выдающиеся результаты в независимых тестах. Gemini 3.8 Flash TTS занял 1-е место в Voice Design Benchmark от Hume AI с показателем 71.4, а также лидирует в моделировании акцентов (60.8). В слепых тестах Voice Arena модели заняли топ-позиции среди конкурентов в ключевых языках: японском, бразильском португальском, вьетнамском, арабском (MSA), мексиканском испанском и хинди.
| Модель | Ключевая метрика (Hume AI) | Основное назначение |
|---|---|---|
| Gemini 3.8 Flash TTS | #1 Overall Quality Index, 71.4 (Voice Design) | Глубокое творчество, кастомные персонажи, длинные форматы |
| Gemini 3.8 Flash-Lite TTS | #2 Overall Quality Index | Массовый дубляж, голосовые агенты, высокая скорость |
Генерация голосов «с нуля» и репликация
Платформа позволяет создавать уникальные голоса с помощью текстовых промптов, поддерживая более 100 языков и диалектов. Доступна библиотека из 2000+ готовых голосов, включая региональные варианты (квебекский французский, шотландский английский).
Для репликации голоса требуется всего 30 секунд аудиообразца. Система использует верификацию согласия владельца голоса, а все сгенерированные аудиоклипы содержат невидимый водяной знак SynthID и метаданные C2PA для обеспечения прозрачности и безопасности.
Режиссура аудио: контроль над каждой строчкой
Ключевое отличие Gemini 3.8 TTS — возможность детального управления выступлением. Пользователи могут добавлять невербальные звуки (смех, вздохи, <laughs>, |mhm|) и управлять темпом, эмоциями и паузами для каждой реплики. Поддерживается нативная постановка сцен с двумя говорящими, сохраняя естественную смену реплик и минимальное «дрейфование» тембра голоса даже в длинных аудиоформатах.
Источник: Blog ↗
