Релиз модели30 сентября 2026 г., 11:47 МСК🤖 Auto

UniMate: Единая модель для анимации любых скелетов от Princeton и MIT

Исследователи из Princeton, UC Berkeley и MIT представили UniMate — первую открытую модель, способную генерировать анимации для разнообразных 3D-скелетов (от людей до змей) на основе текстового описания.

Баннер новости 8587

Революция в универсальности: от людей до змей

Команда разработчиков, объединяющая специалистов из Princeton University, UC Berkeley, MIT и NTU, выпустила UniMate — архитектуру, решающую главную проблему генеративной анимации: несовместимость топологий скелетов. В отличие от предыдущих моделей, обученных только на человекоподобных ригах, UniMate работает с 13 006 парами «текст-движение» из нового датасета UniML3D. Модель успешно анимирует бипедальных (люди), квадрупедальных (животные), птиц, морских существ, насекомых, змей и даже сочлененные жесткие объекты.

Технические детали и архитектура

Ключевое нововведение UniMate — использование графовых нейронных сетей для обработки пространственных зависимостей суставов. Модель использует два основных подхода к механизму внимания (attention), которые можно комбинировать:

  • Graph AdaLN: Внимание разделено на пространственное (по кадрам) и временное (по суставам) с учетом графового расстояния и глубины скелета. Текстовый промпт модулирует через adaLN.
  • Full Cross-Attention: Единое внимание по всем токенам (суставы × время), где текст входит как ключи и значения в каждый блок.

Обучение происходит методом flow matching (потоковое сопоставление) с использованием маскированного L2-потери, а также дополнительных членов для геодезической ротации и плавности скорости. Для стабилизации обучения применяется EMA (экспоненциальное скользящее среднее) весов.

Сравнение конфигураций обучения

Исследователи предоставили 8 конфигураций обучения, варьируя набор данных и тип внимания. Ниже приведена сводка по основным комбинациям, используемым в статье:

Префикс конфига Набор данных Тип внимания Особенности
uniml3d_* Полный UniML3D (Truebones + Mixamo + Objaverse) graph_adaln / full_cross_attn Универсальная модель для всех типов скелетов
truebones_* Только Truebones (животные) Любой До 100 суставов, 6 слоев сети
mixamo_* Только Mixamo (человек) Любой Один тип скелета, без аугментации топологии
objaverse_* Только Objaverse-XL Любой До 60 суставов, 8 слоев сети, риск нестабильности из-за «битых» ригов

Датасет UniML3D и подготовка данных

Для обучения была создана база UniML3D, включающая анимации из Mixamo, Objaverse-XL и коммерческого пакета Truebones ZOO. Все скелеты приведены к единой канонической форме. Важно отметить: исходные ассеты Truebones являются коммерческими, поэтому команда предоставляет только пайплайн обработки и метаданные, а сами анимации необходимо приобретать отдельно у разработчиков Truebones.

Обработка данных включает экспорт, рендеринг, создание подписей (captioning) с помощью google/flan-t5-base и аннотацию суставов. Текстовые эмбеддинги предварительно кэшируются для ускорения обучения.

Запуск и воспроизводимость

Код и веса моделей (checkpoint'ы) опубликованы на GitHub и Hugging Face. Для запуска требуется Python 3.10 и библиотека 🤗 Accelerate. Модель поддерживает обучение на одной GPU и мульти-GPU конфигурациях. При обучении на данных Objaverse-XL исследователи предупреждают о возможных нестабильностях из-за дефектных rest-поз в исходных ассетах, рекомендуя сначала тестировать на Mixamo и Truebones.

Статья принята к публикации в SIGGRAPH Asia 2026, что подтверждает высокую научную значимость подхода.

Источник: Github ↗