Новые модели и ключевые улучшения
OpenAI представила две новые модели в Realtime API: gpt-realtime-2.1 и gpt-realtime-2.1-mini. Главная инновация — мини-версия теперь поддерживает reasoning (внутреннее рассуждение). Это позволяет агенту «думать» перед ответом, что критично для сложных сценариев: модель может озвучить план действий, пока выполняет функцию (tool use), избегая неловких пауз и прерываний со стороны пользователя.
Вторая крупная новость — снижение p95-задержки (времени отклика в 95-м перцентиле) как минимум на 25% для всех голосовых моделей Realtime. Это достигнуто за счет улучшенного кэширования, что также напрямую влияет на стоимость запросов.
Ценообразование и сравнение моделей
Модель gpt-realtime-2.1-mini сохраняет тарифы предыдущей версии gpt-realtime-mini, но добавляет функционал рассуждения. Старшая модель gpt-realtime-2.1 стоит дороже, но предлагает более точное распознавание алфавитно-цифровых данных и улучшенную обработку тишины/шума.
| Параметр (за 1 млн токенов) | gpt-realtime-2.1 | gpt-realtime-2.1-mini | gpt-realtime-mini (старая) |
|---|---|---|---|
| Reasoning (рассуждение) | Да (настраиваемое) | Да (мини-режим) | Нет |
| Text input | $4.00 | $0.60 | $0.60 |
| Audio input | $32.00 | $10.00 | $10.00 |
| Audio cached input | $0.40 | $0.30 | $0.30 |
| Audio output | $64.00 | $20.00 | $20.00 |
Почему это важно для разработчиков
Раньше голосовые агенты часто «зависали» при вызове внешних функций, так как модель молчала, обрабатывая запрос. Теперь, благодаря reasoning, агент может сказать: «Сейчас проверю ваш заказ», и продолжать генерацию аудио, пока выполняется функция. Это сохраняет естественность диалога.
Разработчики могут настраивать уровень усилий для рассуждения: minimal, low, medium, high, xhigh. По умолчанию стоит low, что минимизирует задержку. Для простых задач это оптимально, для сложных — можно повысить уровень, но это увеличит время ответа и расход токенов.
Практическое применение
Модели готовы к интеграции через WebRTC (для браузеров) и SIP (для телефонии). Примеры использования включают:
- Поддержка клиентов: Агент сам озвучивает шаги проверки счета, вызывая инструменты lookup_account и check_invoice.
- Запись на прием: Точное распознавание дат и подтверждение деталей перед вызовом функции reschedule.
- Полевые данные: Улучшенное распознавание кодов деталей (например, «8-3-5-7-7») благодаря обновленной алфавитно-цифровой модели.
Для кэширования системных промптов и аудио в длинных сессиях цены на кэшированные входные токены снижены до $0.30 за 1 млн для аудио в мини-модели, что делает долгосрочные сессии значительно дешевле.
Источник: MarkTechPost ↗
