Релиз модели6 августа 2026 г., 19:45 МСК🤖 Auto

Bytedance выпустила SeedRealtime: первый аудио-визуальный LLM с полным дуплексом

Bytedance представила SeedRealtime — модель, объединяющую зрение, слух и речь в едином континууме. Это прорыв к «омни-модальному» взаимодействию, устраняющий задержки каскадных систем.

Баннер новости 5233

Архитектурный сдвиг: от каскада к единому потоку

Традиционные голосовые ассистенты страдают от латентности из-за цепочки отдельных модулей: ASR (распознавание речи) → VLM (визуальное понимание) → TTS (синтез речи). SeedRealtime от Bytedance решает эту проблему, используя единую архитектуру для нативной фузии аудио, видео и текста. Модель обрабатывает непрерывные мультимодальные потоки в реальном времени, позволяя пользователю одновременно «смотреть, слушать и говорить» без искусственных пауз.

Ключевые технические преимущества

Система демонстрирует три главных прорыва, отличающих её от полудуплексных аналогов:

  • Совместное аудио-визуальное понимание: Модель разрешает омофоническую неоднозначность речи, опираясь на визуальный контекст, и точно интерпретирует временные ссылки (например, «сделай это сейчас»), связывая увиденное, услышанное и сказанное.
  • Проактивное взаимодействие: В отличие от пассивных систем, SeedRealtime самостоятельно отслеживает изменения в сцене. Если появляется целевой объект (например, ключ на выставке), модель может напомнить о нём без запроса пользователя.
  • Естественный тайминг разговора: Модель распознает состояние пользователя, умеет перебивать, делать паузы и реагировать в нужный момент. Она устойчива к фоновому шуму и чужим разговорам, не срабатывая ложно.

Результаты пользовательского тестирования

Энд-ту-энд оценка людьми (human evaluation) показала значительное улучшение качества взаимодействия по сравнению с каскадными моделями. Главная метрика — устранение неловких пауз и перебиваний.

Метрика / Проблема Результат SeedRealtime
Проблемы с таймингом разговора Снижены в 2 раза (50% улучшение)
Ложные срабатывания от шума Значительно снижены
Плавность завершения диалога Заметно улучшена
Задержка реакции Минимизирована за счет параллельной обработки

Реальные сценарии использования

Bytedance продемонстрировала работу модели в сложных условиях:

  • Шумные компании: В ресторане модель различала голоса четырех друзей, связывая имена с лицами, и учитывала индивидуальные предпочтения (аллергии, желания) при планировании поездки.
  • Туризм и образование: В музее Hebei модель самостоятельно напомнила о нужном экспонате, когда камера на него навелась, и объяснила детали артефактов. При изучении научной статьи (ResNet) она отслеживала страницы и реагировала на ключевые разделы.
  • Бытовые задачи: При приготовлении кофе модель увидела, что пользователь засыпает зерна в портфильтр, и немедленно предупредила о необходимости помола, а также дала совет по времени экстракции, оценив цвет крема визуально.

SeedRealtime уже развернута в промышленном масштабе, открывая путь к истинно омни-модальному интерфейсу, где граница между наблюдением и реакцией стирается.

Источник: Bytedance ↗