Революция в скорости: от итераций к feed-forward
Традиционные методы 3D Gaussian Splatting (3DGS) требуют длительной оптимизации (минуты или часы) для каждой новой сцены. F⁴Splat (Feed-Forward Predictive Densification) решает эту проблему, используя feed-forward нейросеть для прямого предсказания параметров гауссиан. Это позволяет реконструировать 3D-сцену практически мгновенно после получения входных изображений, что критически важно для приложений реального времени, таких как VR/AR и робототехника.
Масштаб обучения и доступные модели
Модель обучена на крупных наборах данных, включая RealEstate10K и ACID. Исследователи выпустили несколько предобученных чекпоинтов, доступных через Hugging Face Hub. Архитектура поддерживает работу с разным количеством входных видов (context views), что дает гибкость в зависимости от доступных данных.
| Модель (Checkpoint) | Набор данных | Входные виды (Views) | Подпапка в репозитории |
|---|---|---|---|
| F4Splat ACID 2-view | ACID | 2 | acid-2view |
| F4Splat RE10K 2-view | RealEstate10K | 2 | re10k-2view |
| F4Splat RE10K 24-view | RealEstate10K | 24 | re10k-24view |
Технические требования и установка
Проект требует современной инфраструктуры для работы с CUDA. Поддерживается Python 3.11 и CUDA 12.8. Для корректной работы необходимо использовать специфические версии PyTorch, совместимые с указанной версией CUDA.
- PyTorch: 2.8.0
- Torchvision: 0.23.0
- Torchaudio: 2.8.0
Установка осуществляется через conda и pip с указанием индекса пакетов для CUDA 12.8. Это обеспечивает стабильность вычислений при работе с тензорами высокой размерности.
Демо и управление плотностью гауссиан
Встроенное демо-приложение (demo/app.py) позволяет загружать от 2 до 16 изображений. Ключевой особенностью является интерактивное управление бюджетом гауссиан (Gaussian budget). Пользователь может выбирать коэффициенты плотности (0.2, 0.4, 0.6, 0.8), что напрямую влияет на количество генерируемых гауссиан (в тысячах) и качество рендеринга.
Демо также генерирует видео-интерполяции, где длина видео зависит от количества входных кадров (по умолчанию 24 кадра на интервал, максимум 192 кадров). Визуализация включает наложение красных маркеров, показывающих расположение гауссиан, что помогает оценить плотность сцены.
Структура данных и обучение
Для обучения и тестирования используется формат PyTorch chunks с файлами .torch и индексом index.json. Поддерживаются датасеты RealEstate10K, DL3DV и ACID. Обучение запускается через скрипты Bash или напрямую через Hydra, с возможностью логирования в Weights & Biases. Чекпоинты и логи сохраняются в директории outputs/.
Работа опубликована в сборнике ECCV 2026 (preprint arXiv:2603.21304). Авторы благодарят разработчиков VGGT, NoPoSplat, AnySplat и gsplat за вклад в развитие open-source экосистемы 3D-реконструкции.
Источник: Github ↗
