Революция в скорости: Tuning-free подход
Исследователи из Endless AI Lab представили метод UP2You, опубликованный на конференции ICLR 2026. Главная инновация заключается в отказе от дорогостоящего и медленного процесса дообучения (fine-tuning) базовых моделей под конкретного пользователя. Вместо этого система использует архитектуру, способную мгновенно реконструировать 3D-аватар человека по набору неструктурированных (unconstrained) фотографий, сделанных в разных условиях.
Технические детали и стек
Решение построено на базе Stable Diffusion 2.1 (модель Manojb/stable-diffusion-2-1-base) и использует BiRefNet (ZhengPeng7/BiRefNet) для точного сегментирования персонажа на фоне. Для работы с 3D-геометрией применяются библиотеки Kaolin (v0.17.0) и PyTorch3D (v0.7.8), что обеспечивает высокую производительность на GPU.
Система требует Python 3.10 и PyTorch 2.4.1. Архитектура интегрирует знания из множества предыдущих работ, включая MV-Adapter, PuzzleAvatar, VGGT и THuman2.1, что позволяет ей обобщать данные из разрозненных источников.
Сравнение с традиционными методами
Традиционные подходы к созданию цифровых двойников часто требуют от 10 до 60 минут дообучения на специфических данных пользователя. UP2You сокращает этот процесс до этапа инференса (inference), делая технологию доступной для реального времени.
| Характеристика | Традиционные методы (Fine-tuning) | UP2You (Tuning-free) |
|---|---|---|
| Время подготовки | 10–60+ минут | Секунды (только инференс) |
| Требования к данным | Строгая геометрия, много ракурсов | Неструктурированные фото (unconstrained) |
| Базовая модель | Часто кастомизированная | Stable Diffusion 2.1 + BiRefNet |
| Вычислительная нагрузка | Высокая (обучение) | Средняя (инференс) |
Как запустить проект
Разработчики предоставили полный код на GitHub. Для запуска инференса достаточно выполнить команду:
python inference_low_gpu.py --base_model_path Manojb/stable-diffusion-2-1-base --segment_model_name ZhengPeng7/BiRefNet --data_dir examples --output_dir outputs
Модели предварительно обученных весов (pretrained_models и human_models) доступны через Hugging Face. Проект поддерживает установку через conda с использованием специфических версий библиотек, таких как Kaolin и PyTorch3D, собранных под CUDA 11.8.
Значение для индустрии
UP2You открывает путь к массовому созданию аватаров для метавселенных, игр и VR-приложений. Возможность получать качественный 3D-результат из обычных фотографий, сделанных в повседневной жизни, без сложной настройки оборудования и длительного обучения, снижает порог входа для создателей контента и разработчиков приложений.
Источник: Github ↗
