Релиз модели31 июля 2026 г., 08:16 МСК🤖 Auto

PolyAI Dialog-RSN-1: Аудио-нативная модель с задержкой <300 мс

PolyAI представила Dialog-RSN-1 — первую аудио-нативную диалоговую модель, объединяющую распознавание речи, управление очередью и вызов функций в одном стеке. Модель уже работает в продакшене, обеспечивая снижение задержки на 37% и рост удержания кли

Баннер новости 4782

Архитектурный сдвиг: от каскада к аудио-нативности

В отличие от традиционных каскадных систем, где ASR (автоматическое распознавание речи) передает в LLM только текстовую транскрипцию, теряя интонацию и паузы, PolyAI Dialog-RSN-1 работает с сырым аудио на входе. Ключевая инновация — модель является аудио-осознанной только на этапе ввода. Генерация речи (TTS) остается отдельным, настраиваемым модулем, что позволяет контролировать произношение и тон ответа, избегая ограничений моделей типа GPT Realtime, где голос «зашит» в модель.

Модель не работает в режиме постоянного стриминга, занимающего GPU. Она запускается по запросу (request-based) через высокочувствительный детектор речи (VAD). Первый токен ответа определяет статус очереди: EMPTY, ONGOING или COMPLETE, что позволяет эффективно управлять очередью звонков.

Производительность и метрики

PolyAI сообщает о впечатляющих показателях задержки и эффективности. Модель оптимизирована для работы на GPU NVIDIA A100 с целевой задержкой менее 300 мс. Достигнуто это за счет префиллинга кэша внимания во время речи пользователя, использования специализированного драфтера с коэффициентом принятия токенов 3.9 и маршрутизации звонков на один GPU.

Метрика / Параметр Значение / Результат Примечание
Задержка ответа (Latency) < 300 мс Целевой показатель для A100 GPU
Снижение задержки (Insurer) -37% Относительное улучшение в страховой компании
Рост удержания (Containment) +11% В ресторанной сети (решение проблем без оператора)
WER (Transcription) Ниже 6.9% Улучшение по сравнению с gpt-4o-transcribe (7.8%)
Коэффициент принятия токенов 3.9 Среднее значение для finetuned speculative drafter

Технические детали и обучение

Модель создана путем пост-обучения (post-training) открытых мультимодальных моделей (Gemma, GPT-OSS, Qwen, Mistral) с использованием контролируемого и усиленного дообучения (SFT и RFT) на внутренних данных PolyAI. Архитектура варьируется от 8B плотных до 30B разреженных моделей. Транскрипция выполняется параллельно с генерацией речи, но после принятия решения моделью, что минимизирует ошибки контекста.

Доступность и внедрение

Dialog-RSN-1 не является open-source решением и не доступна через публичное API. Она интегрируется исключительно через платформу PolyAI. На момент запуска модель поддерживает только английский язык. Для других языков PolyAI рекомендует использовать свою модель Raven 3.5. Решение ориентировано на крупные предприятия с высоким объемом звонков (страхование, финансы, ритейл, телеком), где уже развернуто более 2000 инсталляций компании.

Источник: MarkTechPost ↗