Релиз модели29 июля 2026 г., 11:45 МСК🤖 Auto

OpenAI представила gpt-transcribe и gpt-live-transcribe для аудио

OpenAI выпустила две новые модели для расшифровки речи, заменив устаревшие решения. Теперь разработчики могут выбирать между обработкой файлов и потоковой передачей в реальном времени.

Баннер новости 4618

Новая архитектура: два пути для разных задач

OpenAI официально представила две новые модели для работы с аудио: gpt-transcribe и gpt-live-transcribe. Это не просто обновление, а смена парадигмы. Теперь разработчикам нужно четко разделять сценарии использования: обработка готовых файлов или работа с живым потоком звука.

Ключевое отличие заключается в природе соединения. gpt-transcribe предназначена для загрузки завершенных записей, где вы получаете итоговый текст или стримите его по мере обработки. gpt-live-transcribe требует постоянного WebSocket-соединения и предназначена для микрофонов, звонков и других источников живого аудио, где текст должен появляться мгновенно по мере произнесения слов.

Сравнение моделей и их специализация

OpenAI рекомендует начинать интеграцию именно с новых моделей, оставляя старые (gpt-4o-transcribe, gpt-4o-mini-transcribe, gpt-realtime-whisper) для существующих систем. Для специфических задач предусмотрены отдельные решения, такие как диаризация (разделение говорящих) или создание субтитров.

Задача Рекомендуемая модель Тип обработки
Базовая расшифровка файла gpt-transcribe File transcription
Расшифровка в реальном времени gpt-live-transcribe Realtime transcription
Диаризация (разделение спикеров) gpt-4o-transcribe-diarize File transcription
Субтитры (SRT/VTT) и таймкоды whisper-1 File transcription
Перевод на английский whisper-1 Audio translations endpoint

Улучшение качества через контекст

Новые модели gpt-transcribe и gpt-live-transcribe поддерживают три типа контекстных подсказок, что критически важно для точности в узкоспециализированных доменах:

  • Prompt: Свободный текст о теме или обстановке записи.
  • Keywords: Конкретные термины, имена собственные, названия лекарств или акронимы. Важно: модель не обязана использовать слово, если оно не произнесено, но использует его как подсказку для распознавания.
  • Languages: Список ожидаемых языков (в отличие от старых моделей, здесь используется множественное число для поддержки код-свитчинга).

В сессиях Realtime API модель gpt-transcribe автоматически использует предыдущие расшифрованные реплики как контекст для текущей, что повышает связность текста.

Почему это важно для разработчиков

OpenAI настоятельно рекомендует тестировать новые модели на репрезентативных данных, а не полагаться только на метрику Word Error Rate (WER). Для бизнес-задач важнее точность распознавания конкретных сущностей: номеров заказов, названий препаратов или технических терминов. Старые модели gpt-4o-transcribe и gpt-4o-mini-transcribe больше не являются стартовой точкой для новых интеграций, что сигнализирует о переходе на более мощную архитектуру, способную работать с контекстом и сложными акустическими условиями (шум, плохие микрофоны, телекоммуникационные каналы).

Источник: Openai ↗