Релиз модели20 июля 2026 г., 11:46 МСК🤖 Auto

ByteDance выпустила UniVR: фреймворк для обучения Emu3.5 визуальному ризону

ByteDance открыла код UniVR — системы для SFT и RL-обучения модели Emu3.5. Фреймворк позволяет обучать мультимодальные модели визуальному рассуждению без текстовых пар, используя кастомные функции вознаграждения.

Баннер новости 3937

Суть проекта: Emu3.5 и визуальное рассуждение

ByteDance представила UniVR — end-to-end фреймворк для обучения серии унифицированных генеративных моделей Emu3.5. В отличие от стандартных VLM, UniVR учит модель выполнять сложные визуальные задачи (манипуляции, пространственные головоломки, физическое моделирование) на основе демонстраций, а не пар «изображение-текст».

Базовая архитектура использует Emu3.5 (34B параметров) с VQ-VAE-кодировщиком, который токенизирует изображения и текст в единое дискретное пространство. Модель генерирует визуальные траектории (будущие кадры) авторегрессионно, без промежуточных текстовых цепочек.

Двухэтапный процесс обучения

Обучение разделено на два ключевых этапа, каждый из которых можно адаптировать под свои задачи:

  • 1. Cold Initialization (SFT): Обучение с учителем на 310k образцах из датасета VR-X. Поддерживается как полный fine-tuning, так и LoRA через DeepSpeed ZeRO-3.
  • 2. Reinforcement Learning (RL): Применение алгоритма VR-GRPO на 3k курируемых образцах. Используется кастомный HybridEngine для эффективного rollout.

Инновационная система вознаграждений (VR-GRPO)

Ключевая особенность UniVR — составная функция вознаграждения, оценивающая качество рассуждений модели:

Тип награды Обозначение Описание
Format Reward $R_{\text{format}}$ Налагает структурные ограничения: равномерное разрешение, правильное количество шагов.
Global Reward $R_g$ Оценка завершения задачи через VLM-оценчик (Qwen3-VL-30B) методом попарного сравнения.
Step-focal Reward $R_s$ Выявляет самые неопределенные под-шаги через дисперсию CLIP-признаков и применяет детальную оценку.
Combined Reward $R_{\text{reason}}$ Итоговая метрика: $R_g - \lambda |R_g - R_s|$

Производительность и технические детали

Фреймворк включает патчи для vLLM, обеспечивающие быстрый вывод без CFG (Classifier-Free Guidance). Это дает прирост пропускной способности примерно в 2 раза по сравнению со стандартным режимом CFG. Также добавлена поддержка LoRA для Emu3.5 в vLLM.

Для оценки качества используется бенчмарк VR-X, содержащий 1.5 млн сырых образцов из 16 источников. Обучение требует специфического окружения: torch==2.8.0, transformers==4.57.3, vllm==0.11.0 и flash-attn==2.8.3.

Как адаптировать под свои задачи

UniVR спроектирован как модульная система. Для использования на других визуальных задачах разработчику нужно:

  1. Заменить Data Loader в SFT-части на свой PyTorch Dataset, возвращающий формат: [запрос-изображение, текстовая инструкция, визуальная траектория рассуждения].
  2. Реализовать Reward Server (HTTP-сервер) для RL-части, который будет оценивать rollout-траектории. Достаточно указать путь к серверу в конфиге emu3_grpo_lora.sh.

Код проекта доступен на GitHub в репозитории bytedance/UniVR.

Источник: Github ↗