Технология полного дуплекса: разговор без пауз
OpenAI выпустила новую версию голосовых моделей для ChatGPT, доступную на сайте, в приложениях для Windows, iOS и Android (на Mac голосовой режим пока не поддерживается). Ключевое отличие — использование архитектуры полного дуплекса (full-duplex). В отличие от предыдущих версий, где ИИ мог либо говорить, либо слуать, новая система позволяет вести прерывистый диалог в реальном времени. Модель реагирует на короткие подтверждения, такие как «да» или «угу», и умеет ждать, пока пользователь соберет мысли, не перебивая его.
Два уровня моделей: для подписчиков и бесплатных пользователей
Доступ к обновлению открыт для всех, но качество обработки зависит от статуса аккаунта. OpenAI разделила модели на две категории, что напрямую влияет на скорость и качество ответа:
| Параметр | GPT-Live-1 | GPT-Live-1 mini |
|---|---|---|
| Целевая аудитория | Подписчики Go, Plus, Pro | Бесплатные пользователи |
| Качество звука и реакции | Высокое | Стандартное (оптимизировано по ресурсам) |
| Режим рассуждений (Intelligence) | Instant (по умолчанию) | Instant (по умолчанию) |
Параллельный поиск в интернете во время разговора
Одной из главных фишек стало способность модели выполнять фоновые задачи, не прерывая голосовой поток. В ходе тестирования журналист ZDNet попросил ИИ помочь с настройками камеры на iPad mini. Когда первоначальный совет оказался неверным, пользователь прервал бота, уточнив устройство. GPT-Live-1 мгновенно переключилась на поиск в сети, подтвердила ограничения iPad mini и предложила альтернативные решения через приложение «Фотографии» или сторонние приложения, продолжая голосовое общение без задержек.
Гибкость сценариев: от сторителлинга до перевода
Тесты показали высокую адаптивность модели в различных сценариях:
- Сторителлинг: Пользователь мог в реальном времени менять сюжет (например, перенести героя с Луны на Марс) или темп повествования, а ИИ мгновенно корректировал историю.
- Перевод: Режим живого перевода между английским и французским работал плавно, интегрируясь в естественный ход беседы.
- Глубокие дискуссии: При обсуждении классического кино модель не просто выдавала факты, а вела диалог, предлагая варианты и анализируя предпочтения пользователя.
Проблемы и настройки
Несмотря на прогресс, есть нюансы. Фоновый шум (работающий телевизор, разговоры других людей) может сбивать модель, заставляя ее прерываться, хотя в некоторых тестах помехи игнорировались успешно. Пользователям рекомендуется использовать настройки «Intelligence» (Instant, Medium, High) в зависимости от сложности задачи. Для голосового общения рекомендуется оставить режим «Instant», чтобы минимизировать задержки. Также доступна кастомизация голоса: можно выбрать пол, акцент и конкретные профили, такие как британский акцент «Vale».
Источник: ZDNet AI ↗
