Релиз модели16 сентября 2026 г., 00:17 МСК🤖 Auto

Google Gemini 3.8 Live: Прорыв в голосовых агентах с рейтингом 82.6

Google выпустила модели Gemini 3.8 Live и Extended Thinking для production-голосовых агентов. Новые модели занимают 1-е место в бенчмарке Artificial Analysis и предлагают прямое преобразование речи в речь с фоновым выполнением задач.

Баннер новости 7575

Суть обновления: Наследники Gemini 3.5

Google представила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, ставшие самым продвинутым поколением моделей для живого диалога. Эти модели являются частью семейства Gemini Audio, расширенного в прошлом месяце выпуском Gemini 3.5 Transcribe. Главная цель релиза — устранение разрыва в создании голосовых агентов, способных рассуждать и выполнять инструменты (tools) без разрыва разговорного потока. В отличие от каскадных пайплайнов, объединяющих ASR, LLM и TTS, новые модели работают как нативные speech-to-speech решения.

Два продукта для разных задач

Релиз включает две модели с разными профилями производительности:

  • Gemini 3.8 Live: Оптимизирована для масштабируемости и экономической эффективности. Обеспечивает плавный диалог и визуальное обоснование (visual grounding).
  • Gemini 3.8 Live Extended Thinking: Предназначена для сложных задач. Добавляет многошаговое рассуждение (multi-step reasoning) во время говорения. Модель использует ранние вербальные подсказки (например, «Дайте мне проверить это»), чтобы подтвердить запрос, а затем озвучивает ход выполнения долгих задач.

Результаты бенчмарков

Модель Extended Thinking демонстрирует лидерские позиции в индустриальных тестах. Ниже приведены ключевые метрики, подтверждающие её статус:

Бенчмарк / Индекс Результат Значение
Artificial Analysis Speech to Speech Quality Index 82.6 #1 место (Overall)
τ-Voice (Agentic task completion) 68.6% Лидерство в выполнении задач
Sierra’s τ-Voice-banking 35.1% Высокая точность в банковском секторе
Big Bench Audio 97.7% Рейтинг рассуждений для аудио
ServiceNow EVA-Bench Сдвиг Парето-фронта для сложных рабочих процессов

Технические возможности для разработчиков

Live API предоставляет 5 ключевых функций, которые меняют архитектуру голосовых приложений:

  • Асинхронный вызов функций: Модель выполняет API-запросы в фоне, продолжая транслировать аудиоответ пользователю без пауз.
  • Визуальный контекст: Обработка живых визуальных данных в near real-time для понимания того, что пользователь говорит и видит.
  • Алфавитно-цифровая точность: Корректная обработка кодов подтверждения, номеров полисов и технических данных, что часто является точкой отказа в голосовых системах.
  • Мультиязычность: Автоматическое переключение между 97 языками в середине разговора с сохранением акцента.
  • Инкрементальные обновления: Слияние реального аудио со структурированными данными для контекстно-зависимых ответов.

Ценообразование и экосистема

Модели доступны через Gemini Live API и Google AI Studio. Это хостинговые модели (hosted models), поэтому вариант self-hosted отсутствует. Все сгенерированное аудио содержит невидимый водяной знак SynthID от Google DeepMind.

Тарификация:

  • Ввод аудио: $0.005/мин (эквивалент $3/1M токенов).
  • Вывод аудио: $0.018/мин (эквивалент $12/1M токенов).

Интеграция поддерживается партнерами, такими как Agora, LiveKit, LangChain, Vercel, а также стратегическими партнерами Salesforce, Genspark и Lumeris, которые отмечают низкую задержку и плавность диалога.

Источник: MarkTechPost ↗