Инструменты3 октября 2026 г., 23:20 МСК🤖 Auto

Как создать голосового агента: архитектура Alex и борьба за 200 мс

Разбор архитектуры голосового AI-агента Alex, который ведет переговоры по телефону. Почему конвейерная обработка важнее end-to-end моделей и как система различает паузу и конец реплики.

Баннер новости 8875

Сложность за фасадом простоты

На первый взгляд, общение с голосовым агентом кажется простым: вы говорите — оно отвечает. Однако за одним таким обменом скрывается работа шести небольших моделей, выполняющих действия на каждом шаге разговора. Главная проблема здесь не в том, что сказать, а в том, когда это сказать. Искусственный интеллект должен имитировать человеческую скорость реакции, которая в среднем составляет около 200 миллисекунд между окончанием речи одного собеседника и началом ответа другого.

Архитектура: Конвейер против End-to-End

Агент Alex, разработанный для переговоров о фрахтовых ставках, использует не монолитные модели «звук-в-звук» (такие как OpenAI Realtime API или Google Gemini Live), а классический конвейерный подход. Причина — необходимость строгой проверки данных. Каждая озвученная цена должна быть верифицирована кодом, который работает только с текстом. Это добавляет задержку, но обеспечивает безопасность и контроль.

Технический стек и шаги обработки

Система построена на базе фреймворка LiveKit Agents и обрабатывает аудиопоток через WebRTC (пакеты по 20 мс). Процесс разбивается на четыре критических этапа:

  • Прослушивание (Listening): Распознавание речи в реальном времени. Используется модель Deepgram Nova-3 в мультиязычном режиме, позволяющем переключаться между английским и испанским языками в ходе одного звонка.
  • Определение момента окончания речи (Turn Detection): Самая сложная часть. Система должна отличить техническую паузу от конца предложения.
  • Мышление (Think): Генерация ответа на основе текста.
  • Озвучивание (Speak): Синтез речи и мгновенное прекращение, если собеседник перебивает.

Проблема «Обрыва» и Turn Detection

Ключевой вызов — различие между молчанием и незавершенной мыслью. В системе задействованы две модели:

  1. Voice Activity Detection (VAD): Определяет наличие звука или тишины.
  2. Turn Detector: Анализирует интонацию и контекст. Например, если собеседник говорит: «Я могу сделать это за тридцать два...» и делает паузу, VAD может ошибочно решить, что речь окончена. Turn Detector же понимает, что предложение не завершено, и ждет продолжения (например, «...пятьдесят»), чтобы агент не озвучил неверную цену ($3,200 вместо $32,050).

Почему это важно

Проект Alex демонстрирует, что создание «человечного» голосового ИИ — это не только вопрос качества синтеза речи, но и тонкой настройки таймингов. Использование гибридной архитектуры (текстовый конвейер + строгая логика проверки) позволяет избежать фатальных ошибок в бизнес-переговорах, где цена ошибки измеряется деньгами, а не просто неловкой паузой.

Источник: Towards AI pub ↗