Инструменты7 октября 2026 г., 19:46 МСК🤖 Auto

DistScene: Автогенерация 3D-сцен из одного изображения

Новая архитектура DistScene решает проблему нехватки данных для 3D-генерации, используя самодистилляцию и Trellis.2 для создания физически корректных сцен из одного входного изображения.

Баннер новости 9131

Проблема данных и решение через самодистилляцию

Основной барьер для обучения моделей генерации 3D-сцен — отсутствие масштабных датасетов с качественными аннотациями. Команда исследователей (Kunming Luo, Xuelong Li, Ping Tan и др.) предложила метод DistScene (Object-to-Scene Distillation), который автоматически генерирует обучающие данные. Процесс включает два этапа:

  • Генерация объектов: Используется модель Trellis.2 для создания 3D-ассетов.
  • Сборка сцены: Визуально-языковая модель (VLM) описывает объекты и окружение, после чего ассеты размещаются в среде с проверкой физики (physics checks) и рендерингом conditioning-изображений.

Единое представление сцены: Scene Frame

В отличие от подходов, генерирующих объекты по отдельности, DistScene использует Scene Frame — общую рамку, где среда и объекты генерируются совместно. Процесс делится на две стадии:

  1. Генерация разреженной структуры (sparse structure): Определение базовой геометрии и расположения.
  2. Генерация геометрии-латента (geometry-latent): Детализация форм.

Ключевая инновация — Object-Centric Refinement. Каждый объект трансформируется в локальный воксельный блок для уточнения с учетом контекста сцены, а затем возвращается обратно в общую сцену с помощью обратной трансформации. Это обеспечивает согласованность освещения и теней.

Практическое применение: Навигация и симуляция

Сгенерированные сцены не просто визуализируются, но и готовы к использованию в симуляторах навигации. Благодаря композиционному характеру генерации, DistScene позволяет напрямую импортировать результаты в среды для обучения роботов или агентов ИИ. Это закрывает разрыв между генеративным ИИ и симуляцией.

Технические детали и доступность

Проект представлен на arXiv. Исследователи отмечают, что интерактивные демо-версии показывают сжатые превью (около 10% от оригинального объема генерации) для экономии ресурсов браузера. Полный код, чекпоинты и датасет будут опубликованы на GitHub в ближайшее время.

Компонент Описание Роль в DistScene
Trellis.2 Генератор 3D-ассетов Создает базовые объекты сцены
VLM (Vision-Language Model) Визуально-языковая модель Генерирует текстовые описания для условий рендеринга
Scene Frame Единая структура Объединяет генерацию окружения и объектов
Physics Checks Физическая валидация Обеспечивает корректное размещение объектов без проваливания

Источник: Github ↗