Релиз модели23 сентября 2026 г., 19:47 МСК🤖 Auto

Google представила Gemini 3.8 TTS: SOTA в генерации голоса и 100+ языках

Google выпустила модели Gemini 3.8 Flash TTS и Flash-Lite, ставшие лидерами бенчмарков Hume AI. Теперь можно создавать кастомные голоса, реплицировать речь по 30-секундному образцу и управлять эмоциями в реальном времени.

Баннер новости 8114

Два новых уровня производительности

Google анонсировала две новые модели семейства Gemini Audio, трансформирующие подход к синтезу речи. Gemini 3.8 Flash TTS позиционируется как инструмент для глубокого креативного контроля, позволяющий создавать персонажей с нуля. Gemini 3.8 Flash-Lite TTS оптимизирована для масштабируемости и высокой стоимости эффективности, что делает её идеальной для дубляжа и голосовых агентов.

Модели доступны через Google AI Studio, Gemini API, Gemini Enterprise и интегрированы в Google Vids. Они дополняют линейку Gemini 3.5 Live Translate и 3.8 Live, расширяя возможности работы с аудио.

Лидерство в бенчмарках и языках

Новые модели заняли первые места в независимых тестах. Gemini 3.8 Flash TTS показала лучший результат в Voice Design Benchmark от Hume AI, а также лидирует в моделировании акцентов. В слепых тестах Voice Arena модели превзошли конкурентов в ключевых языках, включая японский, бразильский португальский, вьетнамский, арабский (MSA), мексиканский испанский и хинди.

Метрика / Модель Gemini 3.8 Flash TTS Gemini 3.8 Flash-Lite TTS
Hume AI Voice Design Benchmark #1 (71.4) Информация недостаточна
Hume AI Accent Modeling #1 (60.8) Информация недостаточна
Hume AI Overall Quality Index #1 #2
Поддержка языков Более 100 языков и диалектов
Библиотека голосов 2000+ готовых голосов (включая региональные вариации)

Генеративный дизайн и репликация голоса

Ключевая особенность Flash-версии — возможность создавать уникальные голоса с помощью текстовых промптов (например, «дракон, дышащий огнем» или «радио-диджей из Мельбурна»). Также доступна репликация голоса: достаточно 30-секундного аудиообразца. Для защиты от злоупотреблений система требует вербального согласия владельца голоса и использует водяные знаки SynthID и стандарты C2PA.

Режиссура сцены и контроль эмоций

Модели позволяют управлять каждой репликой. Разработчики могут добавлять невербальные звуки (, , ) и интерjections (|mhm|, |yeah|) для создания реалистичных диалогов. Поддерживается нативная постановка сцен с двумя говорящими, сохраняющая качество голоса на протяжении часовых аудиокниг без дрейфа характеристик.

Доступность и безопасность

Разработчики уже могут тестировать возможности в Google AI Studio. Встроенные инструменты безопасности, включая верификацию согласия и невидимое водяное знаки SynthID, призваны обеспечить прозрачность использования AI-генерации и защитить права вокальных талантов.

Источник: Blog ↗