Проблема фрагментации городских сервисов
Современные города полагаются на множество цифровых сервисов, но они работают изолированно. Жителям сложно взаимодействовать с разрозненными платформами, а существующие городские фундаментальные модели и интеллектуальные помощники решают лишь узкие задачи. Главная проблема — неспособность конвертировать сложные запросы на естественном языке в исполняемые кросс-системные рабочие процессы.
Архитектура UrbanAgent
Команда во главе с Цзяю Цао (Jiayu Cao) предложила фреймворк UrbanAgent, который сочетает когнитивные способности больших языковых моделей с набором инструментов. Ключевые компоненты системы:
- Исполнение кода: возможность генерировать и запускать скрипты.
- Вызовы API: прямое взаимодействие с внешними сервисами.
- Model Context Protocol (MCP): стандартизированный протокол для контекста.
Система работает через адаптивную замкнутую петлю: она сначала уточняет недостающую информацию, затем привязывает использование инструментов к живым наблюдениям и, наконец, согласовывает ответ с полученными доказательствами и ограничениями задачи.
Новый бенчмарк Urban-Eval
Для оценки качества работы была создана специализированная метрика Urban-Eval. В отличие от предыдущих наборов данных, которые проверяли либо общие навыки использования инструментов, либо городские знания, Urban-Eval оценивает:
- Результаты выполнения задачи.
- Качество выполнения (execution quality).
- Необходимое покрытие инструментов (tool coverage).
- Валидность зависимостей между шагами.
- Прослеживаемость доказательств (evidence traceability).
Результаты и сравнение с базовыми моделями
Эксперименты показали, что UrbanAgent достигает 71% успеха в задачах, что на 10 процентных пунктов выше самого сильного базового уровня. Превосходство сохраняется независимо от выбранной базовой LLM. Ниже приведена сравнительная таблица эффективности:
| Базовая модель | Результат UrbanAgent | Примечание |
|---|---|---|
| GPT-5-mini | 71% (успех) | Превосходство над базой +10 п.п. |
| Gemini-2.5-flash | 71% (успех) | Стабильный результат |
| DeepSeek-V4-flash | 71% (успех) | Стабильный результат |
| Qwen3-235B-A22B | 71% (успех) | Стабильный результат |
Работа опубликована 4 августа 2026 года в arXiv (cs.AI) и демонстрирует переход от простых чат-ботов к автономным агентам, способным управлять сложными межсистемными взаимодействиями в городской среде.
Источник: arXiv cs.AI ↗
