Инструменты2 июля 2026 г., 11:46 МСК🤖 Auto

UP2You: Быстрое 3D-реконструирование себя по фото без дообучения

Новая модель UP2You (ICLR 2026) позволяет создавать детализированные 3D-аватары из неструктурированных коллекций фотографий за секунды, полностью избегая этапа дообучения (tuning-free).

Баннер новости 2793

Революция в скорости: Tuning-free подход

Исследователи из Endless AI Lab представили метод UP2You, опубликованный на конференции ICLR 2026. Главная инновация заключается в отказе от дорогостоящего и медленного процесса дообучения (fine-tuning) базовых моделей под конкретного пользователя. Вместо этого система использует архитектуру, способную мгновенно реконструировать 3D-аватар человека по набору неструктурированных (unconstrained) фотографий, сделанных в разных условиях.

Технические детали и стек

Решение построено на базе Stable Diffusion 2.1 (модель Manojb/stable-diffusion-2-1-base) и использует BiRefNet (ZhengPeng7/BiRefNet) для точного сегментирования персонажа на фоне. Для работы с 3D-геометрией применяются библиотеки Kaolin (v0.17.0) и PyTorch3D (v0.7.8), что обеспечивает высокую производительность на GPU.

Система требует Python 3.10 и PyTorch 2.4.1. Архитектура интегрирует знания из множества предыдущих работ, включая MV-Adapter, PuzzleAvatar, VGGT и THuman2.1, что позволяет ей обобщать данные из разрозненных источников.

Сравнение с традиционными методами

Традиционные подходы к созданию цифровых двойников часто требуют от 10 до 60 минут дообучения на специфических данных пользователя. UP2You сокращает этот процесс до этапа инференса (inference), делая технологию доступной для реального времени.

Характеристика Традиционные методы (Fine-tuning) UP2You (Tuning-free)
Время подготовки 10–60+ минут Секунды (только инференс)
Требования к данным Строгая геометрия, много ракурсов Неструктурированные фото (unconstrained)
Базовая модель Часто кастомизированная Stable Diffusion 2.1 + BiRefNet
Вычислительная нагрузка Высокая (обучение) Средняя (инференс)

Как запустить проект

Разработчики предоставили полный код на GitHub. Для запуска инференса достаточно выполнить команду:

  • python inference_low_gpu.py --base_model_path Manojb/stable-diffusion-2-1-base --segment_model_name ZhengPeng7/BiRefNet --data_dir examples --output_dir outputs

Модели предварительно обученных весов (pretrained_models и human_models) доступны через Hugging Face. Проект поддерживает установку через conda с использованием специфических версий библиотек, таких как Kaolin и PyTorch3D, собранных под CUDA 11.8.

Значение для индустрии

UP2You открывает путь к массовому созданию аватаров для метавселенных, игр и VR-приложений. Возможность получать качественный 3D-результат из обычных фотографий, сделанных в повседневной жизни, без сложной настройки оборудования и длительного обучения, снижает порог входа для создателей контента и разработчиков приложений.

Источник: Github ↗