Проблема данных и решение через самодистилляцию
Основной барьер для обучения моделей генерации 3D-сцен — отсутствие масштабных датасетов с качественными аннотациями. Команда исследователей (Kunming Luo, Xuelong Li, Ping Tan и др.) предложила метод DistScene (Object-to-Scene Distillation), который автоматически генерирует обучающие данные. Процесс включает два этапа:
- Генерация объектов: Используется модель Trellis.2 для создания 3D-ассетов.
- Сборка сцены: Визуально-языковая модель (VLM) описывает объекты и окружение, после чего ассеты размещаются в среде с проверкой физики (physics checks) и рендерингом conditioning-изображений.
Единое представление сцены: Scene Frame
В отличие от подходов, генерирующих объекты по отдельности, DistScene использует Scene Frame — общую рамку, где среда и объекты генерируются совместно. Процесс делится на две стадии:
- Генерация разреженной структуры (sparse structure): Определение базовой геометрии и расположения.
- Генерация геометрии-латента (geometry-latent): Детализация форм.
Ключевая инновация — Object-Centric Refinement. Каждый объект трансформируется в локальный воксельный блок для уточнения с учетом контекста сцены, а затем возвращается обратно в общую сцену с помощью обратной трансформации. Это обеспечивает согласованность освещения и теней.
Практическое применение: Навигация и симуляция
Сгенерированные сцены не просто визуализируются, но и готовы к использованию в симуляторах навигации. Благодаря композиционному характеру генерации, DistScene позволяет напрямую импортировать результаты в среды для обучения роботов или агентов ИИ. Это закрывает разрыв между генеративным ИИ и симуляцией.
Технические детали и доступность
Проект представлен на arXiv. Исследователи отмечают, что интерактивные демо-версии показывают сжатые превью (около 10% от оригинального объема генерации) для экономии ресурсов браузера. Полный код, чекпоинты и датасет будут опубликованы на GitHub в ближайшее время.
| Компонент | Описание | Роль в DistScene |
|---|---|---|
| Trellis.2 | Генератор 3D-ассетов | Создает базовые объекты сцены |
| VLM (Vision-Language Model) | Визуально-языковая модель | Генерирует текстовые описания для условий рендеринга |
| Scene Frame | Единая структура | Объединяет генерацию окружения и объектов |
| Physics Checks | Физическая валидация | Обеспечивает корректное размещение объектов без проваливания |
Источник: Github ↗
