Архитектура GPT-Live: Full-Duplex и делегирование
OpenAI представила новое поколение голосовых моделей — GPT-Live и GPT-Live-1 mini, которые уже доступны глобально в ChatGPT. В отличие от предыдущих систем, GPT-Live использует архитектуру full-duplex, позволяющую модели слушать и говорить одновременно. Это устраняет задержки, характерные для каскадных систем (STT → LLM → TTS), и позволяет модели использовать бэкканнелы (например, «м-м», «да») во время речи пользователя.
Ключевое нововведение — делегирование. Когда требуется глубокий поиск или сложный анализ, GPT-Live не прерывает поток, а передает задачу фоновой модели. На старте этим «мозгом» выступает GPT-5.5. Пока GPT-5.5 обрабатывает запрос, GPT-Live продолжает поддерживать беседу, создавая эффект естественного диалога.
Сравнение поколений голосовых интерфейсов
OpenAI провела сравнительный анализ трех подходов. Переход от каскадных систем к turn-based (Advanced Voice Mode) улучшил скорость, но сохранил проблему прерываний из-за пауз. GPT-Live решает это через непрерывную обработку:
| Параметр | Каскадная (старая) | Turn-based (Advanced) | Full-duplex (GPT-Live) |
|---|---|---|---|
| Пайплайн | STT → LLM → TTS | Одна модель, дискретные ходы | Непрерывная обработка |
| Слушает во время речи | Нет | Нет | Да |
| Бэкканнелы | Нет | Нет | Да (поддержка диалога) |
| Глубокие вычисления | Встроенные | Встроенные | Делегирование GPT-5.5 |
Результаты тестирования и бенчмарки
В ходе человеческих тестов (5–10 минут диалога) модели GPT-Live-1 и GPT-Live-1 mini были сильно предпочтены пользователям по сравнению с Advanced Voice Mode. Автоматические тесты также показали значительный прогресс GPT-Live-1:
- GPQA: Превосходство в экспертных научных рассуждениях.
- BrowseComp: Сильные улучшения в агентном веб-поиске.
- τ³-Voice Telecom: Лучшее выполнение многошаговых задач поддержки (тестировалось на внутренней вариации с использованием пользовательской модели на базе последних reasoning-моделей).
Для обеспечения скорости используются разные версии фона: GPT-5.5 Instant для версий Instant/Mini и GPT-5.5 Thinking (Medium/High effort) для версий Medium/High.
Что доступно сейчас, а что в планах
На старте GPT-Live интегрирована в голосовой режим ChatGPT. API для разработчиков пока не доступно, но планируется в ближайшее время. Важные ограничения запуска:
- Отсутствует поддержка видео и демонстрации экрана.
- Полное мультиязычное паритетное качество еще не достигнуто.
OpenAI отмечает, что более 150 миллионов человек уже используют голосовой режим ChatGPT, и GPT-Live призвана сделать этот опыт значительно более естественным, позволяя прерывать бота, перебивать его и получать ответы на сложные вопросы без разрыва потока речи.
Источник: MarkTechPost ↗
