Новая архитектура: два пути для разных задач
OpenAI официально представила две новые модели для работы с аудио: gpt-transcribe и gpt-live-transcribe. Это не просто обновление, а смена парадигмы. Теперь разработчикам нужно четко разделять сценарии использования: обработка готовых файлов или работа с живым потоком звука.
Ключевое отличие заключается в природе соединения. gpt-transcribe предназначена для загрузки завершенных записей, где вы получаете итоговый текст или стримите его по мере обработки. gpt-live-transcribe требует постоянного WebSocket-соединения и предназначена для микрофонов, звонков и других источников живого аудио, где текст должен появляться мгновенно по мере произнесения слов.
Сравнение моделей и их специализация
OpenAI рекомендует начинать интеграцию именно с новых моделей, оставляя старые (gpt-4o-transcribe, gpt-4o-mini-transcribe, gpt-realtime-whisper) для существующих систем. Для специфических задач предусмотрены отдельные решения, такие как диаризация (разделение говорящих) или создание субтитров.
| Задача | Рекомендуемая модель | Тип обработки |
|---|---|---|
| Базовая расшифровка файла | gpt-transcribe | File transcription |
| Расшифровка в реальном времени | gpt-live-transcribe | Realtime transcription |
| Диаризация (разделение спикеров) | gpt-4o-transcribe-diarize | File transcription |
| Субтитры (SRT/VTT) и таймкоды | whisper-1 | File transcription |
| Перевод на английский | whisper-1 | Audio translations endpoint |
Улучшение качества через контекст
Новые модели gpt-transcribe и gpt-live-transcribe поддерживают три типа контекстных подсказок, что критически важно для точности в узкоспециализированных доменах:
- Prompt: Свободный текст о теме или обстановке записи.
- Keywords: Конкретные термины, имена собственные, названия лекарств или акронимы. Важно: модель не обязана использовать слово, если оно не произнесено, но использует его как подсказку для распознавания.
- Languages: Список ожидаемых языков (в отличие от старых моделей, здесь используется множественное число для поддержки код-свитчинга).
В сессиях Realtime API модель gpt-transcribe автоматически использует предыдущие расшифрованные реплики как контекст для текущей, что повышает связность текста.
Почему это важно для разработчиков
OpenAI настоятельно рекомендует тестировать новые модели на репрезентативных данных, а не полагаться только на метрику Word Error Rate (WER). Для бизнес-задач важнее точность распознавания конкретных сущностей: номеров заказов, названий препаратов или технических терминов. Старые модели gpt-4o-transcribe и gpt-4o-mini-transcribe больше не являются стартовой точкой для новых интеграций, что сигнализирует о переходе на более мощную архитектуру, способную работать с контекстом и сложными акустическими условиями (шум, плохие микрофоны, телекоммуникационные каналы).
Источник: Openai ↗
