Суть обновления: Наследники Gemini 3.5
Google представила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, ставшие самым продвинутым поколением моделей для живого диалога. Эти модели являются частью семейства Gemini Audio, расширенного в прошлом месяце выпуском Gemini 3.5 Transcribe. Главная цель релиза — устранение разрыва в создании голосовых агентов, способных рассуждать и выполнять инструменты (tools) без разрыва разговорного потока. В отличие от каскадных пайплайнов, объединяющих ASR, LLM и TTS, новые модели работают как нативные speech-to-speech решения.
Два продукта для разных задач
Релиз включает две модели с разными профилями производительности:
- Gemini 3.8 Live: Оптимизирована для масштабируемости и экономической эффективности. Обеспечивает плавный диалог и визуальное обоснование (visual grounding).
- Gemini 3.8 Live Extended Thinking: Предназначена для сложных задач. Добавляет многошаговое рассуждение (multi-step reasoning) во время говорения. Модель использует ранние вербальные подсказки (например, «Дайте мне проверить это»), чтобы подтвердить запрос, а затем озвучивает ход выполнения долгих задач.
Результаты бенчмарков
Модель Extended Thinking демонстрирует лидерские позиции в индустриальных тестах. Ниже приведены ключевые метрики, подтверждающие её статус:
| Бенчмарк / Индекс | Результат | Значение |
|---|---|---|
| Artificial Analysis Speech to Speech Quality Index | 82.6 | #1 место (Overall) |
| τ-Voice (Agentic task completion) | 68.6% | Лидерство в выполнении задач |
| Sierra’s τ-Voice-banking | 35.1% | Высокая точность в банковском секторе |
| Big Bench Audio | 97.7% | Рейтинг рассуждений для аудио |
| ServiceNow EVA-Bench | — | Сдвиг Парето-фронта для сложных рабочих процессов |
Технические возможности для разработчиков
Live API предоставляет 5 ключевых функций, которые меняют архитектуру голосовых приложений:
- Асинхронный вызов функций: Модель выполняет API-запросы в фоне, продолжая транслировать аудиоответ пользователю без пауз.
- Визуальный контекст: Обработка живых визуальных данных в near real-time для понимания того, что пользователь говорит и видит.
- Алфавитно-цифровая точность: Корректная обработка кодов подтверждения, номеров полисов и технических данных, что часто является точкой отказа в голосовых системах.
- Мультиязычность: Автоматическое переключение между 97 языками в середине разговора с сохранением акцента.
- Инкрементальные обновления: Слияние реального аудио со структурированными данными для контекстно-зависимых ответов.
Ценообразование и экосистема
Модели доступны через Gemini Live API и Google AI Studio. Это хостинговые модели (hosted models), поэтому вариант self-hosted отсутствует. Все сгенерированное аудио содержит невидимый водяной знак SynthID от Google DeepMind.
Тарификация:
- Ввод аудио: $0.005/мин (эквивалент $3/1M токенов).
- Вывод аудио: $0.018/мин (эквивалент $12/1M токенов).
Интеграция поддерживается партнерами, такими как Agora, LiveKit, LangChain, Vercel, а также стратегическими партнерами Salesforce, Genspark и Lumeris, которые отмечают низкую задержку и плавность диалога.
Источник: MarkTechPost ↗
