Исследования5 августа 2026 г., 20:19 МСК🤖 Auto

UrbanAgent: AI-агент для управления городом с точностью 71%

Исследователи представили UrbanAgent — систему, объединяющую LLM и инструменты для выполнения сложных городских задач. Новый бенчмарк Urban-Eval показал, что метод превосходит аналоги на 10%.

Баннер новости 5146

Проблема фрагментации городских сервисов

Современные города полагаются на множество цифровых сервисов, но они работают изолированно. Жителям сложно взаимодействовать с разрозненными платформами, а существующие городские фундаментальные модели и интеллектуальные помощники решают лишь узкие задачи. Главная проблема — неспособность конвертировать сложные запросы на естественном языке в исполняемые кросс-системные рабочие процессы.

Архитектура UrbanAgent

Команда во главе с Цзяю Цао (Jiayu Cao) предложила фреймворк UrbanAgent, который сочетает когнитивные способности больших языковых моделей с набором инструментов. Ключевые компоненты системы:

  • Исполнение кода: возможность генерировать и запускать скрипты.
  • Вызовы API: прямое взаимодействие с внешними сервисами.
  • Model Context Protocol (MCP): стандартизированный протокол для контекста.

Система работает через адаптивную замкнутую петлю: она сначала уточняет недостающую информацию, затем привязывает использование инструментов к живым наблюдениям и, наконец, согласовывает ответ с полученными доказательствами и ограничениями задачи.

Новый бенчмарк Urban-Eval

Для оценки качества работы была создана специализированная метрика Urban-Eval. В отличие от предыдущих наборов данных, которые проверяли либо общие навыки использования инструментов, либо городские знания, Urban-Eval оценивает:

  • Результаты выполнения задачи.
  • Качество выполнения (execution quality).
  • Необходимое покрытие инструментов (tool coverage).
  • Валидность зависимостей между шагами.
  • Прослеживаемость доказательств (evidence traceability).

Результаты и сравнение с базовыми моделями

Эксперименты показали, что UrbanAgent достигает 71% успеха в задачах, что на 10 процентных пунктов выше самого сильного базового уровня. Превосходство сохраняется независимо от выбранной базовой LLM. Ниже приведена сравнительная таблица эффективности:

Базовая модель Результат UrbanAgent Примечание
GPT-5-mini 71% (успех) Превосходство над базой +10 п.п.
Gemini-2.5-flash 71% (успех) Стабильный результат
DeepSeek-V4-flash 71% (успех) Стабильный результат
Qwen3-235B-A22B 71% (успех) Стабильный результат

Работа опубликована 4 августа 2026 года в arXiv (cs.AI) и демонстрирует переход от простых чат-ботов к автономным агентам, способным управлять сложными межсистемными взаимодействиями в городской среде.

Источник: arXiv cs.AI ↗