Новый стандарт взаимодействия: Omni Agentic Interaction
Команды Tencent Hunyuan и OpenBMB представили Gander — первого агента, способного одновременно воспринимать аудио, видео и текст, вести диалог и выполнять сложные задачи. В отличие от традиционных LLM, Gander не просто отвечает на запросы, а активно участвует в процессе: прерывает пользователя, реагирует на визуальные события в реальном времени и управляет фоновыми задачами, пока пользователь продолжает общение.
Архитектура «Мозжечок-Мозг» (Cerebellum–Brain)
Ключевое нововведение Gander — разделение ответственности между двумя компонентами:
- Front Cerebellum (Передний мозжечок): Обрабатывает аудио и видео в реальном времени (пакеты по 1 секунде). Отвечает за распознавание намерений, прерывания, «backchannels» (подтверждения прослушивания) и мгновенную реакцию.
- Back Brain (Задний мозг): Занимается сложным логическим выводом, использованием инструментов и выполнением длительных задач. Этот модуль можно заменять без дообучения всей системы.
Координация между ними происходит через Agent Orchestration Runtime, который управляет состоянием задач, позволяя пользователю вносить изменения в фоновый процесс через голос или текст.
Ключевые возможности и метрики
Gander демонстрирует навыки, недоступные стандартным чат-ботам. Ниже приведены основные сценарии работы:
| Категория | Функциональность | Пример использования |
|---|---|---|
| Omni Perception | Синхронизация аудио, видео и текста | Пользователь просит создать игру Tetris, затем показывает экран и голосом просит изменить цвет кнопки паузы. |
| Full-Duplex Dialogue | Двусторонний диалог без задержек | Агент различает «угу» (продолжает говорить) и «подожди» (прекращает речь), слушая пользователя во время своего ответа. |
| Proactive Alerting | Активное оповещение о визуальных событиях | Пользователь просит сообщить, когда на видео появится пингвин. Агент следит за кадром и прерывает молчание при появлении цели. |
| Simultaneous Translation | Потоковый перевод речи | Мгновенный перевод с китайского на английский и обратно во время обсуждения планов релиза. |
| Interference Resistance | Фильтрация фонового шума | Агент игнорирует посторонние голоса в кафе и отвечает только на вопрос пользователя о потерянном паспорте. |
Технические детали модели
Передний «мозжечок» использует архитектуру Streaming Thinker–Talker. Модель обрабатывает входные данные блоками по 1 секунде, сохраняя контекст последних 128 единиц (токенов/секунд). Это позволяет агенту принимать решения о том, слушать, говорить, прерывать или вызывать инструменты, практически без задержки.
Система поддерживает асинхронное выполнение задач: пользователь может начать запрос на исследование документа, а затем уточнять детали или проверять прогресс через голосовой интерфейс, пока Gander работает в фоне.
Источник: Github ↗
