Проблема существующих методов
Традиционные подходы к генерации 3D-сцен из текста (text-to-3D) часто требуют часов итеративного использования инструментов для достижения приемлемого качества. Хотя такие методы обеспечивают физическую прочность и семантическую согласованность объектов, их вычислительная сложность и время генерации остаются критическим барьером для практического применения в реальном времени.
Решение SceneMosaic
Команда разработчиков из Гонконгского университета (HKU) и Университета электроники и технологий Китая (UESTC) представила SceneMosaic — новую архитектуру, использующую агентный подход (Agentic text-to-3D). Система автоматизирует процесс компоновки сцены, обеспечивая:
- Высокую детализацию (High fidelity) объектов и окружения;
- Семантическую согласованность между элементами сцены;
- Физическую корректность взаимодействия объектов;
- Значительное сокращение времени генерации по сравнению с итеративными методами.
Технические особенности
В отличие от монолитных моделей, SceneMosaic использует модульную структуру, где каждый объект и его позиция в сцене обрабатываются как независимые агенты, координирующие свои действия для достижения общей целостности сцены. Это позволяет избежать артефактов и неестественных соединений, характерных для простых генеративных моделей.
Значение для индустрии
Разработка SceneMosaic открывает новые возможности для индустрии видеоигр, виртуальной реальности и цифровых двойников, где требуется быстрое создание сложных, детализированных 3D-окружений. Снижение порога входа в создание 3D-контента позволит художникам и разработчикам фокусироваться на креативных аспектах, а не на технических ограничениях генерации.
Источник: Github ↗
