Главная/Блог/Аналитика/Gemini 3.8 TTS: Новый уровень синтеза…
Аналитика7 мин чтения · 24 сентября 2026 г.

Gemini 3.8 TTS: Новый уровень синтеза речи с мультиголосыми диалогами

Разбираем новый API синтеза речи от Google Gemini 3.8, интерактивную песочницу и возможности создания многоголосых диалогов с кастомными голосами.

Gemini 3.8 TTS: Новый уровень синтеза речи с мультиголосыми диалогами

Синтез речи (Text-to-Speech, TTS) давно перестал быть просто технической функцией для озвучки роботов или навигаторов. В эпоху больших языковых моделей (LLM) голос стал новым интерфейсом взаимодействия, позволяющим создавать более естественные, эмоциональные и иммерсивные цифровые продукты. 23 сентября 2026 года Google сделала важный шаг в этом направлении, представив две новые модели: gemini-3.8-flash-tts и gemini-3.8-flash-lite-tts. Эти модели не просто улучшили качество звучания, но и радикально изменили подход к созданию аудиоконтента, предложив инструменты для работы с многоголосыми диалогами и кастомными голосами прямо через API.

Чтобы протестировать новые возможности, разработчик Саймон Уиллисон (Simon Willison) создал интерактивную песочницу (playground) на базе GPT-6 Astra. Этот инструмент позволяет не только генерировать речь, но и экспериментировать с настройками, сохранять конфигурации в виде ссылок и делиться ими. В этой статье мы подробно разберем, что нового предлагают модели Gemini 3.8, как работает песочница, какие технические нюансы стоит учитывать при запуске локально или через API, и почему это изменение может стать поворотным моментом для создателей подкастов, аудиокниг и интерактивных приложений.

01Новые модели: Flash и Flash-Lite

Google выпустила две версии своих новых моделей синтеза речи, каждая из которых решает свои задачи. gemini-3.8-flash-tts — это флагманская модель, ориентированная на максимальное качество звука. Она способна генерировать речь с высокой степенью естественности, интонационной выразительностью и точной артикуляцией. Эта модель подходит для проектов, где аудио является ключевым элементом пользовательского опыта: аудиокниги, озвучка персонажей в играх, профессиональные подкасты и виртуальные ассистенты высокого уровня.

Второй вариант, gemini-3.8-flash-lite-tts, позиционируется как более легкая и экономичная альтернатива. Она жертвует некоторой глубиной эмоциональной окраски и детализацией в пользу скорости генерации и снижения стоимости запросов. Это идеальный выбор для приложений с высокой нагрузкой, где важна скорость отклика, но не требуется кинематографическое качество звука. Например, для озвучки уведомлений, кратких информационных сообщений или фоновой речи в мобильных приложениях.

💡
Совет по выбору. Если вы разрабатываете прототип или MVP, начните с Flash-Lite для оптимизации затрат. Переходите на полную версию Flash, когда качество звука станет критическим фактором для удержания пользователей.

02Библиотека голосов и кастомизация

Одним из самых впечатляющих преимуществ новой экосистемы Gemini является масштаб библиотеки голосов. Пользователям доступен выбор более чем из 2000 голосов на различных языках. Это позволяет находить уникальные тембры, акценты и стили речи, которые ранее требовали долгого поиска или записи студийных дублей.

Но настоящая революция кроется в возможности создания кастомных голосов. Google предлагает функцию, позволяющую создать уникальный голос, используя всего 30-секундный аудиофайл. Важно отметить, что у вас должны быть права на использование этого голоса. Это может быть ваш собственный голос, голос актера, с которым у вас есть договоренность, или даже синтезированный голос, права на который вам принадлежат.

Процесс создания кастомного голоса выглядит следующим образом:

  1. Запишите 30 секунд чистой речи без фоновых шумов.
  2. Загрузите файл в интерфейс API или песочницы.
  3. Дождитесь обработки модели, которая извлечет тембральные характеристики.
  4. Используйте полученный "voice ID" в последующих запросах на генерацию речи.
Gemini 3.8 TTS: Новый уровень синтеза речи с мультиголосыми диалогами

Это открывает невероятные возможности для персонализации. Представьте, что вы создаете интерактивную историю, где главный герой говорит вашим голосом, или разрабатываете образовательный курс, где лектор звучит как ваш любимый эксперт. Технология "bring-your-own-key" (принеси свой ключ), реализованная в песочнице Саймона, позволяет интегрировать эти кастомные голоса в ваши собственные приложения без необходимости хранения тяжелых локальных моделей.

03Интерактивная песочница (Playground)

Саймон Уиллисон, известный своими экспериментами с AI-инструментами, создал демонстрационную песочницу, чтобы показать мощь нового API. Эта песочница написана с использованием GPT-6 Astra и использует открытый CORS-политику Gemini API, что позволяет запускать её прямо в браузере без сложной настройки серверной части.

Основные функции песочницы:

  • Композиция диалогов: Вы можете создавать сценарии с несколькими персонажами, назначая каждому свой голос и стиль речи (например, шепот, крик, радость, грусть).
  • Предпросмотр: Мгновенное прослушивание результата перед сохранением.
  • Детали запросов: Возможность увидеть структуру JSON-запроса и ответа, что полезно для разработчиков, желающих интегрировать API в свой код.
  • Сохранение настроек: Все параметры генерации сохраняются в URL. Вы можете скопировать ссылку и отправить её коллеге, который сразу увидит те же настройки и сможет воспроизвести или изменить результат.
⚠️ Важно.
Песочница использует ваш собственный API-ключ Gemini. Убедитесь, что вы понимаете политику тарификации Google Cloud, так как генерация аудио может потреблять значительные квоты при интенсивном тестировании.

04Демонстрация: Диалог пеликанов

Чтобы продемонстрировать возможности мультиголосого синтеза, Саймон написал сценарий с помощью Claude 4.5 Opus. Сюжет прост: два пеликана спорят о том, стоит ли им переезжать на пирс в Пасифике. Затем этот текст был отправлен в инструмент генерации аудио.

Результат превзошел ожидания. Аудиофайл длительностью 1 минуту 18 секунд был сгенерирован за ~20 секунд с использованием модели Gemini 3.8 Flash TTS. Стоимость этого процесса составила всего 2.74 цента (USD). Это демонстрирует исключительную эффективность модели: высокая скорость, низкая стоимость и при этом высокое качество, позволяющее различить разных персонажей и их эмоциональные состояния.

Такая скорость и цена делают технологию доступной для массового использования. Раньше создание качественного многоголосого аудио требовало участия нескольких дикторов, студии звукозаписи и редакторов, что обходилось в сотни долларов и занимало дни. Теперь это можно сделать за секунды и копейки.

Gemini 3.8 TTS: Новый уровень синтеза речи с мультиголосыми диалогами

05Техническая интеграция и локальный запуск

Для разработчиков, желающих интегрировать Gemini TTS в свои проекты, важно понимать технические детали. API работает по принципу REST, что упрощает интеграцию с любыми языками программирования. Однако, из-за ограничений CORS в некоторых браузерах, прямые запросы из клиентского JavaScript могут быть заблокированы. Именно поэтому песочница Саймона использует прокси или серверную часть, либо полагается на открытую политику Google для тестовых целей.

Если вы планируете запускать генерацию речи локально или на своем сервере, рекомендуется использовать асинхронные запросы, так как генерация аудио может занимать время. Также важно правильно обрабатывать ошибки и лимиты запросов (rate limits).

terminalpython
import requests

# Пример запроса к Gemini TTS API
url = "https://texttospeech.googleapis.com/v1/text:synthesize"
headers = {
    "Authorization": "Bearer YOUR_API_KEY",
    "Content-Type": "application/json; charset=utf-8"
}

payload = {
    "input": {"text": "Привет, это тестовый диалог."},
    "voice": {
        "languageCode": "ru-RU",
        "name": "ru-RW-Standard-A",  # Пример имени голоса
        "ssmlGender": "FEMALE"
    },
    "audioConfig": {
        "audioEncoding": "MP3",
        "speakingRate": 1.0,
        "pitch": 0.0
    }
}

response = requests.post(url, headers=headers, json=payload)

if response.status_code == 200:
    with open("output.mp3", "wb") as f:
        f.write(response.json()["audioContent"])
    print("Аудио сохранено.")
else:
    print(f"Ошибка: {response.status_code}")
📌 Факт.
Google поддерживает множество форматов аудио, включая MP3, WAV и LINEAR16. Для веб-приложений MP3 является оптимальным выбором благодаря балансу качества и размера файла.

06Этические аспекты и безопасность

С развитием технологий синтеза речи возрастает риск их misuse (злоупотребления). Возможность создания кастомных голосов на основе 30-секундного образца открывает двери для создания дипфейков и мошеннических схем. Google заявляет, что требует от пользователей наличия прав на использование голосов, но технически проверить это сложно.

Разработчикам следует внедрять механизмы верификации и водяные знаки в аудиофайлы, если это возможно. Также важно информировать пользователей о том, что они слушают сгенерированный контент. Этика AI — это не просто абстракция, а практическая необходимость для долгосрочного доверия к технологиям.

07Что это значит на практике

Для создателей контента, разработчиков и бизнеса новые модели Gemini 3.8 TTS означают следующее:

  1. Демократизация производства аудио: Теперь даже небольшие команды или отдельные создатели могут производить качественный многоголосый контент без студии. Это снижает барьер входа в нишу аудиоподкастов и интерактивных историй.
  2. Масштабируемость: Возможность генерировать часы аудио за минуты позволяет масштабировать контент-стратегии. Например, локализация контента на десятки языков с сохранением стиля оригинала становится экономически целесообразной.
  3. Персонализация в реальном времени: В образовательных и развлекательных приложениях можно динамически менять голоса персонажей в зависимости от предпочтений пользователя или контекста сцены.
  4. Снижение затрат: Стоимость в 2.74 цента за минуту диалога делает TTS одной из самых дешевых форм создания аудиоконтента, сопоставимой с текстовым генеративным AI.

Интеграция таких технологий в продукты уже сегодня может стать конкурентным преимуществом. Пользователи ожидают более естественного взаимодействия, и голос — это следующий шаг после текста. Google Gemini 3.8 предоставляет инструменты, чтобы этот шаг был плавным, качественным и доступным.

Экспериментируйте с песочницей, пробуйте разные голоса и стили. Возможно, именно ваш проект станет тем самым примером того, как AI-синтез речи изменил индустрию. Помните, что качество контента всегда будет зависеть от качества сценария и режиссуры, даже если голос генерирует машина.

Источник: Simon Willison ↗