Главная/Блог/Аналитика/PolyAI Dialog-RSN-1: Революция…
Аналитика7 мин чтения · 31 июля 2026 г.

PolyAI Dialog-RSN-1: Революция аудио-интеллекта в реальном времени

PolyAI представил Dialog-RSN-1 — первую аудио-нативную модель диалога, объединяющую распознавание речи, управление очередью и вызов функций в одном решении с задержкой менее 300 мс.

PolyAI Dialog-RSN-1: Революция аудио-интеллекта в реальном времени

В мире искусственного интеллекта, где гонка за параметрами и размерами моделей часто затмевает практическую применимость, PolyAI делает шаг, который может переопределить стандарты взаимодействия человека с машиной. Компания представила Dialog-RSN-1 — революционную аудио-нативную модель диалога, которая воспринимает аудиопоток звонящего напрямую, минуя традиционный этап преобразования речи в текст (STT/ASR) как отдельный, изолированный блок. Это не просто очередная итерация в развитии языковых моделей; это архитектурный сдвиг, который стирает границы между восприятием, пониманием и реакцией в реальном времени.

В отличие от большинства современных решений, которые полагаются на каскадные стеки, где ошибка на этапе распознавания речи неизбежно искажает понимание контекста, Dialog-RSN-1 объединяет управление очередью (turn-taking), распознавание речи, вызов функций (function calling) и генерацию ответа в единую, целостную систему. Более того, эта модель уже работает в продакшене, обрабатывая реальные звонки, что подтверждает её готовность к промышленному использованию. В этой статье мы подробно разберем архитектуру, преимущества и практическое значение этого прорыва для бизнеса и разработчиков.

01Почему традиционные каскадные системы исчерпали себя?

Чтобы понять масштаб инновации PolyAI, необходимо взглянуть на то, как устроена голосовая AI-интеграция сегодня. Доминирующей архитектурой последние несколько лет оставался каскадный стек. В такой системе аудиосигнал сначала отправляется в систему автоматического распознавания речи (ASR). ASR выдает «лучшую догадку» — текстовую транскрипцию. Затем этот текст передается в большую языковую модель (LLM), которая интерпретирует намерение пользователя и формирует ответ. Наконец, текст ответа преобразуется обратно в речь с помощью системы синтеза речи (TTS).

У этой модели есть критический недостаток: она отбрасывает огромное количество информации. Тон голоса, паузы, колебания, эмоции и даже неопределенность самого распознавателя (когда ASR «сомневается» в слове) исчезают еще до того, как LLM получает данные. LLM видит только сухой текст, лишенный интонационной окраски. Для настройки таких систем инженерам приходится вручную подстраивать параметры определения конца реплики (end-pointing) и использовать biasing для ASR, что редко дает хорошие результаты при переходе от одного сценария к другому.

Существуют также модели «speech-to-speech», такие как GPT Realtime или Gemini Live, которые сохраняют аудио на входе. Однако они часто «запекают» голосовые характеристики прямо в модель, что ограничивает контроль над произношением. Кроме того, многие из них требуют постоянного потока данных (always-on stream), что приводит к тому, что мощный GPU занят под один звонок на протяжении всей беседы, что экономически неэффективно для масштабируемых решений.

02Архитектура Dialog-RSN-1: Аудио-нативность с умным управлением ресурсами

Dialog-RSN-1 предлагает элегантное решение этих проблем. Ключевая особенность архитектуры заключается в том, что модель является аудио-осознанной (audio-aware) только на стороне входа. Она принимает сырой аудиопоток, но генерирует ответ, передавая его в отдельную, настраиваемую систему синтеза речи (TTS). Это сохраняет полный контроль над голосом агента, позволяя бизнесу выбирать любые голоса, акценты и стили, не будучи привязанным к «встроенному» голосу модели.

Но самое важное — это подход к вычислительным ресурсам. Dialog-RSN-1 работает не как постоянно активный поток, который «висит» на GPU, а как модель, запрашиваемая по требованию (request-based). Система использует высокочувствительный детектор голоса (VAD) и набор таймеров, чтобы решить, когда именно нужно «будить» модель. Это позволяет эффективно распределять вычислительную мощность между тысячами одновременных звонков.

PolyAI Dialog-RSN-1: Революция аудио-интеллекта в реальном времени

Управление очередью (turn-taking) — это первый токен ответа модели. Модель может выдать один из трех состояний:

  • EMPTY: Пауза, нет необходимости отвечать.
  • ONGOING: Пользователь еще говорит, модель ждет.
  • COMPLETE: Пользователь закончил, модель готова генерировать ответ.

Важно отметить, что дешевые акустические сигналы (такие как тишина) лишь определяют когда спросить модель, но само решение о том, что говорить, принимает модель, имея полный контекст разговора. Это обеспечивает естественность диалога, сопоставимую с человеческим.

💡
Ключевая особенность. Dialog-RSN-1 не требует постоянного подключения GPU. Модель активируется только в момент необходимости принятия решения, что радикально снижает стоимость владения (TCO) по сравнению с решениями, требующими выделенных ресурсов на весь звонок.

03Как была создана модель: От данных к суб-300 мс

Создание Dialog-RSN-1 потребовало сложной инженерной работы, направленной на достижение задержки менее 300 миллисекунд на GPU NVIDIA A100. PolyAI не создавала архитектуру с нуля, а провела пост-обучение (post-training) открытых мультимодальных моделей, используя контролируемое и усиленное дообучение (supervised and reinforcement finetuning) на собственных данных.

Процесс оценки базовых моделей был широким: PolyAI тестировала Gemma, GPT-OSS, Qwen и Mistral. В конечном итоге для достижения целевых показателей производительности были выбраны модели в диапазоне от 8 миллиардов плотных параметров до 30 миллиардов разреженных (sparse). Это оптимальный баланс между скоростью инференса и способностью к пониманию контекста.

Для минимизации задержки PolyAI внедрила несколько продвинутых техник:

PolyAI Dialog-RSN-1: Революция аудио-интеллекта в реальном времени
  1. Предварительное заполнение кэша внимания (Prefilling): Пока пользователь говорит, модель уже начинает обрабатывать контекст, заполняя кэш внимания, что экономит время при генерации ответа.
  2. Шаблон запроса только для добавления (Append-only): Это минимизирует инвалидацию кэша, когда контекст расширяется.
  3. Рутинг на один GPU: Каждый звонок маршрутизируется на один и тот же GPU, что сохраняет локальность данных и ускоряет доступ к кэшу.
  4. Спекулятивный драфтер (Speculative Drafter): Был дообучен специальный драфтер, который принимает в среднем 3.9 токенов за шаг, значительно ускоряя генерацию.
  5. Авто-рассуждение (Auto-reasoning): Научено в процессе усиленного обучения (RFT), что позволяет модели быстрее приходить к логическим выводам.

Транскрипция разговора, необходимая для архивов и анализа, выполняется только после того, как ответ сгенерирован или вызвана функция, и происходит параллельно с синтезом речи, не блокируя основной поток.

04Результаты и бенчмарки: Цифры, которые говорят сами за себя

PolyAI оценила Dialog-RSN-1 с помощью внутреннего бенчмарка Dialog-Eval, который, как планируется, будет открыт для сообщества. Методология оценки уникальна: каждый пример представляет собой звонок, обрезанный в точке принятия решения, и оценивается один атомарный следующий шаг, а не полная разворачивающаяся сцена (rollout). Это позволяет точнее измерять способность модели к мгновенной реакции.

Результаты впечатляют:

  • Dialog-RSN-1 показала наивысший балл среди всех моделей, способных работать в реальном времени.
  • Предел качества для каскадных систем (Audio-score) находится на уровне около 77, тогда как Dialog-RSN-1 превосходит этот порог.
  • Интересно, что GPT Realtime 2.1 показала результаты, сопоставимые с каскадными системами на аудио-осознанных примерах, но Dialog-RSN-1 демонстрирует лучшие показатели в части задержки и эффективности.

В части распознавания речи (WER - Word Error Rate), использование контекста от Dialog-RSN-1 позволило улучшить результат gpt-4o-transcribe с 7.8% до 6.9%. При этом сама Dialog-RSN-1 показывает еще более низкий уровень ошибок, так как она обучалась на сырых аудио данных, а не на промежуточных транскриптах.

PolyAI Dialog-RSN-1: Революция аудио-интеллекта в реальном времени
⚠️
Важно для бизнеса. PolyAI сообщает о снижении задержки на 37% у одного из крупных страховых клиентов и увеличении показателя удержания звонка (containment) на 11% в ресторанной сети. Эти метрики напрямую влияют на операционные расходы и удовлетворенность клиентов.

05Практическое применение: Для кого и где?

Dialog-RSN-1 не является открытой моделью (open weights) или публичным API, доступным для самостоятельного скачивания. Она поставляется через платформу PolyAI. Это стратегическое решение: компания нацелена на крупные предприятия с высоким объемом звонков, у которых уже есть 100+ корпоративных клиентов и более 2000 живых развертываний. Самостоятельные разработчики и малый бизнес не являются целевой аудиторией на данном этапе.

Модель идеально подходит для отраслей, где критична скорость и естественность диалога:

  • Рестораны и гостиничный бизнес: Бронирование столиков и номеров, ответы на частые вопросы.
  • Страхование и финансы: Обработка претензий, аутентификация клиентов, маршрутизация звонков.
  • Здравоохранение: Запись на прием, напоминания, предварительный сбор анамнеза.
  • Ритейл и телеком: Управление заказами, техническая поддержка, обработка платежей.

Приложения варьируются от простого бронирования и управления заказами до сложной аутентификации и устранения неполадок. Важно отметить, что на момент запуска модель поддерживает только английский язык. Для других языков PolyAI рекомендует использовать свою модель Raven 3.5, которая лучше справляется с веб-чатами и многоязычными сценариями.

06Что это значит на практике

Внедрение Dialog-RSN-1 знаменует собой переход от «роботизированных» голосовых помощников к истинно интеллектуальным агентам, которые понимают не только слова, но и контекст общения. Для бизнеса это означает:

  1. Снижение операционных затрат: За счет эффективного использования GPU и снижения задержки компании могут обрабатывать больше звонков с меньшими вычислительными ресурсами.
  2. Повышение качества обслуживания: Естественное управление очередью и учет интонации делают диалог менее раздражающим для клиентов, что повышает лояльность.
  3. Гибкость: Разделение аудио-восприятия и синтеза речи позволяет легко менять голосовые профили без переобучения основной модели.

Хотя модель пока доступна только через платформу PolyAI и только на английском языке, её архитектура задает новый стандарт для индустрии. Ожидается, что в будущем PolyAI откроет данные для бенчмарка Dialog-Eval и опубликует технический отчет, что позволит сообществу глубже изучить этот подход. Для компаний, готовых инвестировать в передовые решения для клиентского сервиса, Dialog-RSN-1 — это не просто обновление, а новая эра голосового AI.

📌
Факт. PolyAI завершила раунд финансирования Series D на сумму $86 млн в декабре 2025 года, что свидетельствует о высокой уверенности инвесторов в потенциал аудио-нативных решений и растущем спросе на такие технологии в корпоративном секторе.

Источник: MarkTechPost ↗