Релиз модели8 июля 2026 г., 21:16 МСК🤖 Auto

OpenAI представила GPT-Live: голосовые модели с full-duplex и делегированием GPT-5.5

OpenAI выпустила GPT-Live и GPT-Live-1 mini для ChatGPT. Новые модели поддерживают одновременное слушание и говорение, а сложные задачи делегируют фоновой модели GPT-5.5.

Баннер новости 3136

Архитектура GPT-Live: Full-Duplex и делегирование

OpenAI представила новое поколение голосовых моделей — GPT-Live и GPT-Live-1 mini, которые уже доступны глобально в ChatGPT. В отличие от предыдущих систем, GPT-Live использует архитектуру full-duplex, позволяющую модели слушать и говорить одновременно. Это устраняет задержки, характерные для каскадных систем (STT → LLM → TTS), и позволяет модели использовать бэкканнелы (например, «м-м», «да») во время речи пользователя.

Ключевое нововведение — делегирование. Когда требуется глубокий поиск или сложный анализ, GPT-Live не прерывает поток, а передает задачу фоновой модели. На старте этим «мозгом» выступает GPT-5.5. Пока GPT-5.5 обрабатывает запрос, GPT-Live продолжает поддерживать беседу, создавая эффект естественного диалога.

Сравнение поколений голосовых интерфейсов

OpenAI провела сравнительный анализ трех подходов. Переход от каскадных систем к turn-based (Advanced Voice Mode) улучшил скорость, но сохранил проблему прерываний из-за пауз. GPT-Live решает это через непрерывную обработку:

Параметр Каскадная (старая) Turn-based (Advanced) Full-duplex (GPT-Live)
Пайплайн STT → LLM → TTS Одна модель, дискретные ходы Непрерывная обработка
Слушает во время речи Нет Нет Да
Бэкканнелы Нет Нет Да (поддержка диалога)
Глубокие вычисления Встроенные Встроенные Делегирование GPT-5.5

Результаты тестирования и бенчмарки

В ходе человеческих тестов (5–10 минут диалога) модели GPT-Live-1 и GPT-Live-1 mini были сильно предпочтены пользователям по сравнению с Advanced Voice Mode. Автоматические тесты также показали значительный прогресс GPT-Live-1:

  • GPQA: Превосходство в экспертных научных рассуждениях.
  • BrowseComp: Сильные улучшения в агентном веб-поиске.
  • τ³-Voice Telecom: Лучшее выполнение многошаговых задач поддержки (тестировалось на внутренней вариации с использованием пользовательской модели на базе последних reasoning-моделей).

Для обеспечения скорости используются разные версии фона: GPT-5.5 Instant для версий Instant/Mini и GPT-5.5 Thinking (Medium/High effort) для версий Medium/High.

Что доступно сейчас, а что в планах

На старте GPT-Live интегрирована в голосовой режим ChatGPT. API для разработчиков пока не доступно, но планируется в ближайшее время. Важные ограничения запуска:

  • Отсутствует поддержка видео и демонстрации экрана.
  • Полное мультиязычное паритетное качество еще не достигнуто.

OpenAI отмечает, что более 150 миллионов человек уже используют голосовой режим ChatGPT, и GPT-Live призвана сделать этот опыт значительно более естественным, позволяя прерывать бота, перебивать его и получать ответы на сложные вопросы без разрыва потока речи.

Источник: MarkTechPost ↗