Релиз модели9 сентября 2026 г., 21:45 МСК🤖 Auto

Gander: Агент с «мозжечком» для мультиаудиовизуального взаимодействия

Tencent Hunyuan и OpenBMB представили Gander — систему, объединяющую восприятие, речь и действия в реальном времени через архитектуру «Мозжечок-Мозг».

Баннер новости 7109

Новый стандарт взаимодействия: Omni Agentic Interaction

Команды Tencent Hunyuan и OpenBMB представили Gander — первого агента, способного одновременно воспринимать аудио, видео и текст, вести диалог и выполнять сложные задачи. В отличие от традиционных LLM, Gander не просто отвечает на запросы, а активно участвует в процессе: прерывает пользователя, реагирует на визуальные события в реальном времени и управляет фоновыми задачами, пока пользователь продолжает общение.

Архитектура «Мозжечок-Мозг» (Cerebellum–Brain)

Ключевое нововведение Gander — разделение ответственности между двумя компонентами:

  • Front Cerebellum (Передний мозжечок): Обрабатывает аудио и видео в реальном времени (пакеты по 1 секунде). Отвечает за распознавание намерений, прерывания, «backchannels» (подтверждения прослушивания) и мгновенную реакцию.
  • Back Brain (Задний мозг): Занимается сложным логическим выводом, использованием инструментов и выполнением длительных задач. Этот модуль можно заменять без дообучения всей системы.

Координация между ними происходит через Agent Orchestration Runtime, который управляет состоянием задач, позволяя пользователю вносить изменения в фоновый процесс через голос или текст.

Ключевые возможности и метрики

Gander демонстрирует навыки, недоступные стандартным чат-ботам. Ниже приведены основные сценарии работы:

Категория Функциональность Пример использования
Omni Perception Синхронизация аудио, видео и текста Пользователь просит создать игру Tetris, затем показывает экран и голосом просит изменить цвет кнопки паузы.
Full-Duplex Dialogue Двусторонний диалог без задержек Агент различает «угу» (продолжает говорить) и «подожди» (прекращает речь), слушая пользователя во время своего ответа.
Proactive Alerting Активное оповещение о визуальных событиях Пользователь просит сообщить, когда на видео появится пингвин. Агент следит за кадром и прерывает молчание при появлении цели.
Simultaneous Translation Потоковый перевод речи Мгновенный перевод с китайского на английский и обратно во время обсуждения планов релиза.
Interference Resistance Фильтрация фонового шума Агент игнорирует посторонние голоса в кафе и отвечает только на вопрос пользователя о потерянном паспорте.

Технические детали модели

Передний «мозжечок» использует архитектуру Streaming Thinker–Talker. Модель обрабатывает входные данные блоками по 1 секунде, сохраняя контекст последних 128 единиц (токенов/секунд). Это позволяет агенту принимать решения о том, слушать, говорить, прерывать или вызывать инструменты, практически без задержки.

Система поддерживает асинхронное выполнение задач: пользователь может начать запрос на исследование документа, а затем уточнять детали или проверять прогресс через голосовой интерфейс, пока Gander работает в фоне.

Источник: Github ↗