Проблема традиционных подходов
Городское планирование — это сложная задача пространственной оптимизации, где необходимо выбирать действия из огромного пространства кандидатов с учетом стоимости и качества услуг. Существующие методы оптимизации и обучения с подкреплением (RL) часто зависят от специфических для задачи представлений и механизмов обработки ограничений, что ограничивает их универсальность.
Решение: UrbanSandbox и атомарное обучение
Команда авторов (Wentao Zhang, Jingyuan Wang и др.) предложила фреймворк CityPlanner, основанный на UrbanSandbox — унифицированной среде на основе файлов. Агент может просматривать файлы задач, генерировать планы, запускать оценщики и корректировать решения на основе исполняемой обратной связи.
Для упрощения обучения авторы внедрили атомарное обучение с подкреплением, которое разбивает длинные траектории на два этапа:
- BuildPlan: начальное строительство плана.
- ImprovePlan: уточнение на основе обратной связи.
Результаты и сравнение
Эксперименты на реальном бенчмарке показали, что CityPlanner стабильно превосходит эвристические методы, специализированные RL-агенты и общие LLM-агенты. Ниже приведена сравнительная оценка подходов:
| Метод | Тип | Ключевая особенность | Результат (относительное качество) |
|---|---|---|---|
| CityPlanner | Sandbox Agent | Исполняемая обратная связь, атомарное RL | Лучший |
| Task-specific RL | Reinforcement Learning | Специфичные представления | Ниже CityPlanner |
| General LLM-Agent | LLM | Общая генерация | Ниже CityPlanner |
| Heuristic | Эвристика | Ручные правила | Наихудший |
Значение для индустрии
Работа демонстрирует переход от статических моделей к динамическим агентам, способным «исполнять» и проверять свои решения в симулированной среде. Код и датасет опубликованы, что открывает возможности для внедрения AI в реальные процессы урбанистики. Статья находится на рецензировании в EMNLP.
Источник: arXiv cs.AI ↗
