Единый фреймворк для всех 3D-задач
Tencent представила Hunyuan3D-Buffalo 1.0 — унифицированную мультимодальную модель, которая решает сразу четыре ключевые задачи в области 3D: понимание (understanding), генерацию из текста (text-to-3D), редактирование по инструкциям (instruction-guided editing) и генерацию отдельных частей (part-level generation). В отличие от специализированных инструментов, Buffalo 1.0 использует единый бэкбон на базе Hunyuan3D-VLM, который связывает языковые запросы, 3D-представления и генеративные модули.
Техническая архитектура и возможности
Ядро системы построено на архитектуре Vision-Language Model (VLM), что позволяет модели не просто создавать геометрию, но и «понимать» её структуру. На основе унифицированного представления работают модули Hunyuan3D DiT (Diffusion Transformer), обеспечивающие масштабируемую генерацию и высокое качество редактирования. Модель поддерживает семантическую сегментацию объектов, позволяя выделять отдельные части (например, колеса у велосипеда или крылья у самолета) по текстовому запросу.
Практические примеры применения
В демонстрационных материалах Tencent показала способность модели генерировать сложные ассеты с высокой детализацией. Ниже приведены примеры сгенерированных объектов, демонстрирующие разнообразие стилей и структур:
| Тип объекта | Описание и особенности | Ключевые детали |
|---|---|---|
| Человеческий бюст | Реалистичная 3D-модель женщины в профиль | Заколки в волосах, морщины, текстура одежды с биркой |
| Спутник | Технический объект с солнечными панелями | Цилиндрическое тело, симметричные панели (по 3 секции) |
| Стилизированный краб | Арт-объект с преувеличенными пропорциями | 8 ног, клешни с зубцами, сегментированное брюшко |
| Самолет | Одномоторный пропеллерный авиалайнер | Кабина пилота, фиксированное шасси, заклепки на фюзеляже |
| Части объекта | Семантическая декомпозиция (например, велосипеда) | Выделение 6+ отдельных компонентов с возможностью эксплода-визуализации |
Редактирование и сегментация
Особенность Buffalo 1.0 — возможность точечного редактирования 3D-мешей через естественный язык. Пользователь может задать инструкцию (например, «изменить цвет» или «добавить аксессуар»), и модель модифицирует только нужную часть геометрии, сохраняя целостность остального объекта. Также реализована функция извлечения семантических частей: модель может разбить сложный объект (например, дерево или грузовик) на логические компоненты (ствол, ветки, колеса, кузов) для дальнейшего использования в игровых движках или CAD-системах.
Значение для индустрии
Выпуск Hunyuan3D-Buffalo 1.0 знаменует сдвиг от узкоспециализированных нейросетей к универсальным агентам для работы с 3D-контентом. Для разработчиков игр, архитекторов и создателей цифровых двойных это означает возможность быстрого прототипирования: от текстового описания до готового, редактируемого 3D-ассета в формате GLB. Код модели доступен на GitHub, что открывает путь для сообщества к адаптации решения под собственные задачи.
Источник: Github ↗
