Релиз модели3 августа 2026 г., 23:30 МСК🤖 Auto

OpenAI представила GPT-4o Realtime: голосовой AI с задержкой 300 мс

OpenAI выпустила GPT-4o Realtime API, позволяющий создавать голосовые интерфейсы с задержкой менее 300 мс. Технология обеспечивает естественное прерывание диалога и мгновенную реакцию без искусственных пауз.

Баннер новости 4989

Революция в скорости отклика

OpenAI анонсировала GPT-4o Realtime — новую версию API, предназначенную для создания голосовых AI-ассистентов, способных вести естественный диалог в реальном времени. Ключевая особенность системы — задержка (latency) между речью пользователя и ответом модели составляет менее 300 миллисекунд. Это делает общение практически мгновенным, устраняя характерные для предыдущих поколений AI паузы на «мышление».

Техническая архитектура: от аудио к тексту и обратно

Система работает по принципу непрерывного потока (streaming). Аудиовход от пользователя преобразуется в текст с помощью Whisper, обрабатывается моделью GPT-4o, а затем синтезируется в речь через TTS (Text-to-Speech). Весь этот пайплайн оптимизирован для минимизации задержек. Важно отметить, что модель поддерживает мультимодальность: она может одновременно обрабатывать аудио, текст и визуальные данные, что открывает возможности для сложных сценариев взаимодействия.

Ключевые возможности и метрики

Разработчики подчеркивают, что новая система решает главную проблему голосовых AI — неестественность пауз. Теперь пользователь может перебить ассистента, и система мгновенно адаптируется к новому контексту. Ниже приведены основные характеристики новой версии API:

Параметр Значение / Характеристика
Задержка (Latency) Менее 300 мс (в среднем)
Модель GPT-4o (Realtime API)
Поддержка прерываний Да, мгновенная адаптация к речи пользователя
Мультимодальность Аудио, текст, изображения (в зависимости от контекста)
Доступность Открыто для разработчиков через API

Почему это важно для индустрии

Ранее голосовые AI-ассистенты страдали от «роботизированности» из-за задержек на генерацию ответа. GPT-4o Realtime меняет парадигму, позволяя создавать виртуальных помощников, которые звучат как живые собеседники. Это критически важно для сфер поддержки клиентов, образования и развлечений, где естественность диалога является ключевым фактором пользовательского опыта. OpenAI утверждает, что разработчики уже интегрируют эту технологию в свои продукты, что может привести к появлению нового поколения голосовых интерфейсов в ближайшие месяцы.

Источник: OpenAI ↗