В мире искусственного интеллекта, где скорость и естественность взаимодействия становятся ключевыми факторами конкуренции, Google сделала очередной мощный шаг вперед. 15 сентября 2026 года компания официально представила две новые модели — Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Эти разработки позиционируются как прямые аналоги семейства GPT-Live от OpenAI, но с собственной уникальной архитектурой и подходом к обработке звука. Для разработчиков и энтузиастов это не просто обновление списка моделей, а доступ к новому парадигмальному инструменту, позволяющему создавать голосовые интерфейсы без необходимости использования тяжелых библиотек.
Что делает эти модели особенными? В отличие от традиционных систем, где текст преобразуется в речь (TTS), а речь в текст (STT) через отдельные этапы, Gemini 3.8 Live работает как единый речевой процессор. Это означает минимальную задержку, естественную интонацию и возможность прерывания диалога в реальном времени. Пользователь может говорить, и модель реагирует мгновенно, создавая эффект присутствия собеседника. Такой подход открывает двери для создания голосовых ассистентов нового поколения, которые не просто выполняют команды, а ведут живой диалог.
Для демонстрации возможностей новой платформы Simon Willison, известный эксперт в области веб-технологий и AI, создал простой, но эффективный веб-интерфейс. Он использовал модель GPT-6 Astra Extra High для генерации кода, который позволяет пользователям тестировать Gemini 3.8 Live прямо в браузере. Этот интерфейс не требует установки дополнительных библиотек или сложных настроек окружения. Все взаимодействие происходит через прямое подключение к WebSocket-эндпоинту Google и использование нативного Web Audio API. Это демонстрирует, насколько доступным становится разработка сложных AI-интерфейсов.
01Архитектура взаимодействия: WebSocket и Web Audio API
Сердцем новой системы является протокол WebSocket. В отличие от HTTP-запросов, которые требуют отправки данных и ожидания ответа, WebSocket обеспечивает постоянный двунаправленный канал связи. Это критически важно для голосового общения, где задержка должна быть минимальной, чтобы диалог не превращался в череду пауз и молчания. Google предоставляет специальный эндпоинт для работы с Gemini Live:
wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent?key=...Этот URL выглядит сложным, но его структура логична. Он указывает на конкретный сервис (GenerativeService) и метод (BidiGenerateContent), который поддерживает двунаправленную генерацию контента. Ключ API, указанный в конце, обеспечивает аутентификацию и контроль доступа. Для разработчиков, работающих из России, важно отметить, что доступ к этому эндпоинту может требовать настройки сетевых маршрутов, так как прямое подключение к серверам Google из РФ иногда сталкивается с ограничениями. Однако, использование прокси или локальных зеркал может решить эту проблему.
Для захвата и воспроизведения звука Simon Willison использовал Web Audio API. Это стандартный браузерный интерфейс, который позволяет работать с аудио-данными на низком уровне. Камера микрофона захватывает звук, который затем сжимается и отправляется по WebSocket-соединению. Ответ от модели, содержащий аудио-данные, декодируется и воспроизводится через динамики устройства. Такой подход обеспечивает максимальную производительность и минимальные накладные расходы, так как не требует внешних зависимостей.

Почему это важно для разработчиков?
Раньше создание голосового AI-интерфейса требовало интеграции нескольких сервисов: STT-движка, LLM-модели и TTS-движка. Каждый из этих компонентов имел свою задержку, свои ошибки и свои требования к ресурсам. Gemini 3.8 Live объединяет эти функции в одну модель. Это упрощает архитектуру приложения, снижает стоимость разработки и улучшает пользовательский опыт. Разработчики могут сосредоточиться на логике взаимодействия, а не на настройке сложных пайплайнов обработки звука.
02Модели Gemini 3.8 Live и Extended Thinking
Google представила две вариации новой модели. Gemini 3.8 Live ориентирована на скорость и отзывчивость. Она предназначена для диалогов, где важна мгновенная реакция, например, для голосовых помощников или чат-ботов в реальном времени. Вторая модель, Gemini 3.8 Live Extended Thinking, добавляет возможность «расширенного мышления». Это означает, что модель может тратить больше времени на анализ запроса перед ответом, что особенно полезно для сложных задач, требующих глубокого понимания контекста или логических рассуждений.
Разница между этими моделями заключается в балансе между скоростью и глубиной анализа. Для простых вопросов, таких как «какая погода сегодня?», подойдет базовая версия. Для задач, требующих планирования или анализа, лучше использовать Extended Thinking. Важно отметить, что обе модели поддерживают функцию прерывания. Если пользователь начинает говорить, пока модель еще отвечает, система может мгновенно прекратить текущий ответ и переключиться на новый запрос. Это создает ощущение естественного разговора, а не монотонного чтения текста.
Примеры использования
Голосовые интерфейсы на базе Gemini 3.8 Live могут найти применение в самых разных сферах. В образовании это могут быть интерактивные репетиторы, которые отвечают на вопросы учеников в реальном времени. В бизнесе — голосовые ассистенты для поддержки клиентов, способные решать сложные проблемы без передачи на оператора. В развлечении — персонализированные голосовые истории или игры, где игрок может свободно общаться с персонажами. Возможности ограничены только воображением разработчиков.
03Как запустить свой первый голосовой чат
Для тех, кто хочет попробовать новые возможности Gemini Live, Simon Willison подготовил подробное руководство. Процесс начинается с получения API-ключа в Google Cloud Console. Затем необходимо создать простой HTML-файл, который подключается к WebSocket-эндпоинту. Код для захвата звука с микрофона и воспроизведения ответа можно найти в документации Web Audio API. Ниже приведен базовый пример структуры соединения:

const ws = new WebSocket('wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent?key=YOUR_API_KEY');
ws.onopen = () => {
console.log('Connected to Gemini Live');
};
ws.onmessage = (event) => {
// Обработка входящих аудио-данных
const audioData = JSON.parse(event.data);
playAudio(audioData.audio);
};
// Захват звука с микрофона
navigator.mediaDevices.getUserMedia({ audio: true })
.then(stream => {
const audioContext = new AudioContext();
const source = audioContext.createMediaStreamSource(stream);
// Отправка аудио-данных в WebSocket
});Этот код является упрощенным примером. В реальном приложении вам потребуется добавить обработку ошибок, сжатие аудио-данных и управление состоянием соединения. Однако, он демонстрирует простоту интеграции. Не нужно устанавливать Node.js, Python или другие среды выполнения. Все работает прямо в браузере.
Настройка системы
Для запуска примера вам понадобится современный браузер, поддерживающий WebSockets и Web Audio API. Google Chrome, Firefox и Safari отлично подходят для этих целей. Также убедитесь, что у вас есть стабильное интернет-соединение, так как задержка в сети напрямую влияет на качество диалога. Если вы работаете из России, проверьте доступность домена generativelanguage.googleapis.com. В случае блокировок, рассмотрите использование VPN или локальных прокси-серверов.
04Сравнение с OpenAI GPT-Live
Google позиционирует Gemini 3.8 Live как конкурента OpenAI GPT-Live. Оба решения предлагают голосовое взаимодействие с низкой задержкой. Однако, есть ключевые различия. OpenAI делает упор на интеграцию с своей экосистемой, включая ChatGPT и API для разработчиков. Google, в свою очередь, предлагает более гибкую архитектуру, позволяющую работать с WebSocket напрямую. Это дает разработчикам больше контроля над процессом взаимодействия.
Кроме того, Gemini 3.8 Live Extended Thinking предлагает уникальную функцию «расширенного мышления», которой нет в текущих версиях GPT-Live. Это позволяет модели проводить более глубокий анализ перед ответом, что может быть критически важно для сложных задач. С другой стороны, OpenAI может похвастаться более зрелой экосистемой инструментов и документацией. Выбор между ними зависит от конкретных потребностей проекта.
05Что это значит на практике
Появление Gemini 3.8 Live и Extended Thinking знаменует новый этап в развитии голосового AI. Для пользователей это означает более естественное и быстрое взаимодействие с технологиями. Для разработчиков — новые возможности для создания инновационных продуктов. Для бизнеса — снижение затрат на разработку голосовых интерфейсов и улучшение качества обслуживания клиентов.
В ближайшие месяцы мы, вероятно, увидим множество приложений, использующих эти технологии. От умных часов до автомобильных систем, от домашних помощников до корпоративных чат-ботов. Голос становится новым интерфейсом, а Gemini 3.8 Live — одним из ключевых инструментов для его реализации. Следите за обновлениями и экспериментируйте с новыми возможностями. Будущее голосового AI уже здесь.
Источник: Simon Willison ↗
