Релиз модели24 сентября 2026 г., 11:47 МСК🤖 Auto

Google представила Gemini 3.8 TTS: новый стандарт генерации речи

Google выпустила модели Gemini 3.8 Flash TTS и Flash-Lite TTS, лидирующие в бенчмарках Hume AI. Теперь можно создавать кастомные голоса, реплицировать речь по 30-секундному образцу и управлять эмоциями строчно.

Баннер новости 8175

Два новых уровня производительности

Google анонсировала две новые модели синтеза речи в семействе Gemini: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Первая ориентирована на глубокое творческое направление и создание персонажей, вторая — на массовое масштабирование, дубляж и голосовых агентов с высокой эффективностью.

Модели доступны через Google AI Studio, Gemini API, Gemini Enterprise и интегрированы в продукты вроде Gemini Notebook и Google Vids. Это следующий шаг после Gemini 3.5 Live Translate и 3.8 Live, расширяющий возможности аудио-генерации.

Лидерство в бенчмарках и языках

Новые модели демонстрируют выдающиеся результаты в независимых тестах. Gemini 3.8 Flash TTS занял 1-е место в Voice Design Benchmark от Hume AI с показателем 71.4, а также лидирует в моделировании акцентов (60.8). В слепых тестах Voice Arena модели заняли топ-позиции среди конкурентов в ключевых языках: японском, бразильском португальском, вьетнамском, арабском (MSA), мексиканском испанском и хинди.

Модель Ключевая метрика (Hume AI) Основное назначение
Gemini 3.8 Flash TTS #1 Overall Quality Index, 71.4 (Voice Design) Глубокое творчество, кастомные персонажи, длинные форматы
Gemini 3.8 Flash-Lite TTS #2 Overall Quality Index Массовый дубляж, голосовые агенты, высокая скорость

Генерация голосов «с нуля» и репликация

Платформа позволяет создавать уникальные голоса с помощью текстовых промптов, поддерживая более 100 языков и диалектов. Доступна библиотека из 2000+ готовых голосов, включая региональные варианты (квебекский французский, шотландский английский).

Для репликации голоса требуется всего 30 секунд аудиообразца. Система использует верификацию согласия владельца голоса, а все сгенерированные аудиоклипы содержат невидимый водяной знак SynthID и метаданные C2PA для обеспечения прозрачности и безопасности.

Режиссура аудио: контроль над каждой строчкой

Ключевое отличие Gemini 3.8 TTS — возможность детального управления выступлением. Пользователи могут добавлять невербальные звуки (смех, вздохи, <laughs>, |mhm|) и управлять темпом, эмоциями и паузами для каждой реплики. Поддерживается нативная постановка сцен с двумя говорящими, сохраняя естественную смену реплик и минимальное «дрейфование» тембра голоса даже в длинных аудиоформатах.

Источник: Blog ↗