Релиз модели7 июля 2026 г., 10:16 МСК🤖 Auto

OpenAI выпустила GPT-Realtime-2.1: мини-модель с reasoning и снижением задержки на 25%

OpenAI обновила API для голосовых агентов: вышла модель gpt-realtime-2.1-mini с функцией внутреннего рассуждения (reasoning) и снизила p95-задержку на четверть за счет кэширования.

Баннер новости 3015

Новые модели и ключевые улучшения

OpenAI представила две новые модели в Realtime API: gpt-realtime-2.1 и gpt-realtime-2.1-mini. Главная инновация — мини-версия теперь поддерживает reasoning (внутреннее рассуждение). Это позволяет агенту «думать» перед ответом, что критично для сложных сценариев: модель может озвучить план действий, пока выполняет функцию (tool use), избегая неловких пауз и прерываний со стороны пользователя.

Вторая крупная новость — снижение p95-задержки (времени отклика в 95-м перцентиле) как минимум на 25% для всех голосовых моделей Realtime. Это достигнуто за счет улучшенного кэширования, что также напрямую влияет на стоимость запросов.

Ценообразование и сравнение моделей

Модель gpt-realtime-2.1-mini сохраняет тарифы предыдущей версии gpt-realtime-mini, но добавляет функционал рассуждения. Старшая модель gpt-realtime-2.1 стоит дороже, но предлагает более точное распознавание алфавитно-цифровых данных и улучшенную обработку тишины/шума.

Параметр (за 1 млн токенов) gpt-realtime-2.1 gpt-realtime-2.1-mini gpt-realtime-mini (старая)
Reasoning (рассуждение) Да (настраиваемое) Да (мини-режим) Нет
Text input $4.00 $0.60 $0.60
Audio input $32.00 $10.00 $10.00
Audio cached input $0.40 $0.30 $0.30
Audio output $64.00 $20.00 $20.00

Почему это важно для разработчиков

Раньше голосовые агенты часто «зависали» при вызове внешних функций, так как модель молчала, обрабатывая запрос. Теперь, благодаря reasoning, агент может сказать: «Сейчас проверю ваш заказ», и продолжать генерацию аудио, пока выполняется функция. Это сохраняет естественность диалога.

Разработчики могут настраивать уровень усилий для рассуждения: minimal, low, medium, high, xhigh. По умолчанию стоит low, что минимизирует задержку. Для простых задач это оптимально, для сложных — можно повысить уровень, но это увеличит время ответа и расход токенов.

Практическое применение

Модели готовы к интеграции через WebRTC (для браузеров) и SIP (для телефонии). Примеры использования включают:

  • Поддержка клиентов: Агент сам озвучивает шаги проверки счета, вызывая инструменты lookup_account и check_invoice.
  • Запись на прием: Точное распознавание дат и подтверждение деталей перед вызовом функции reschedule.
  • Полевые данные: Улучшенное распознавание кодов деталей (например, «8-3-5-7-7») благодаря обновленной алфавитно-цифровой модели.

Для кэширования системных промптов и аудио в длинных сессиях цены на кэшированные входные токены снижены до $0.30 за 1 млн для аудио в мини-модели, что делает долгосрочные сессии значительно дешевле.

Источник: MarkTechPost ↗