Главная/Блог/Обзор/Google Gemini 3.8 Flash TTS: Голосовой…
Обзор3 мин чтения · 25 сентября 2026 г.

Google Gemini 3.8 Flash TTS: Голосовой ИИ с управлением через промпты

Google выпустила модели Gemini 3.8 Flash TTS и Flash-Lite для генерации речи. Разбор возможностей, бенчмарков и ограничений для разработчиков.

Google Gemini 3.8 Flash TTS: Голосовой ИИ с управлением через промпты

Google представила две новые модели синтеза речи (TTS) в семействе Gemini Audio: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Это самые выразительные аудио-модели компании на данный момент. Ключевое отличие — возможность режиссуры озвучки «по строкам» с помощью естественного языка, что позволяет детально управлять интонацией, паузами и эмоциями персонажей.

01Две модели для разных задач

Google разделила линейку на два уровня производительности и стоимости:

  • Gemini 3.8 Flash TTS: Ориентирована на креативные задачи, создание персонажей для игр, аудиокниг и подкастов. Предлагает глубокий контроль над актерской игрой, диалектами и бэк-каналингом (реакциями слушателя).
  • Gemini 3.8 Flash-Lite TTS: Оптимизирована для массового производства, дубляжа и голосовых агентов. Фокус на высокой скорости и низкой стоимости при сохранении выразительности.
💡
Важно для практиков. Обе модели доступны только через Gemini API и Google AI Studio. Открытых весов (open weights) для локального развертывания на собственном GPU нет. Enterprise-доступ через Gemini Enterprise появится позже.

02Генерация голосов и библиотека

В отличие от предыдущих версий с 30 базовыми голосами, новая архитектура предлагает масштабный выбор:

  • Generative Voice Design: Создание новых голосов по текстовому описанию (роль, акцент, характеристики). Поддерживается более 100 языков и диалектов. Примеры из демо: диджей из Мельбурна, монотонный робот, японский дракон.
  • Библиотека голосов: Более 2000 готовых к продакшену голосов, включая региональные вариации (мексиканский испанский, квебекский французский, шотландский английский).
  • Сохранение и масштабирование: Пользовательские голоса можно сохранять и переиспользовать с минимальным дрейфом качества между проектами.

03Режиссура и технические возможности

Модели принимают сценарные указания, написанные в тексте. Это позволяет управлять производительностью строка за строкой.

  • Долгое формирование: Качество голоса, темп и тембр сохраняются на протяжении часов непрерывного аудио.
  • Нативная постановка двух говорящих: Один скрипт может управлять многооборотным диалогом с разными голосами.
  • Вокальные эффекты: Поддержка невербальных маркеров, таких как <laughs>, <sigh>, <gasp>.
  • Бэк-каналинг: Вставка реакций слушателя, например, |mhm| или |yeah|, для контроля ритма и комедийного тайминга.

04Бенчмарки и качество

Google публикует следующие результаты тестирования:

  • Hume AI Voice Design Benchmark: Flash TTS занимает 1-е место с оценкой 71.4.
  • Accent modeling: Flash TTS лидирует с оценкой 60.8.
  • Hume AI Overall Quality Index: Flash TTS — 1-е место, Flash-Lite — 2-е место.
  • Voice Arena (blind preference): Обе модели занимают топ-позиции в японском, бразильском португальском, вьетнамском, современном арабском, мексиканском испанском и хинди.
⚠️
Ограничения репликации голоса. Для клонирования голоса требуется 30-секундный образец и запись согласия владельца голоса. Функция недоступна в AI Studio в ряде регионов, включая Великобританию, ЕЭЗ и Индию.

05Безопасность и маркировка

Каждый сгенерированный аудиоклип содержит невидимый водяной знак SynthID, встроенный непосредственно в аудио. Голоса, созданные с помощью репликации, также имеют учетные данные контента C2PA. Это часть более широкой стратегии безопасности Gemini 3.8 Audio.

06Кому подойдёт / что запустится

Решение идеально подходит для:

  • Разработчиков игр и интерактивных медиа, нуждающихся в глубокой кастомизации персонажей.
  • Студий дубляжа и создания аудиоконтента, требующих высокой скорости и низкой стоимости (Flash-Lite).
  • Разработчиков голосовых агентов, которым важна естественность и реакция в реальном времени.

Для запуска используйте идентификаторы моделей в Gemini API:

terminalbash
# Пример использования в коде (псевдокод для Gemini API)
model_id = "gemini-3.8-flash-tts"       # Для креативных задач
model_id = "gemini-3.8-flash-lite-tts"  # Для массового производства

Локально развернуть модели невозможно из-за отсутствия открытых весов. Доступ осуществляется исключительно через облачные API Google.

Источник: MarkTechPost ↗