Релиз модели13 июля 2026 г., 11:45 МСК🤖 Auto

UniVR: ИИ, мыслящий в визуальном пространстве, а не в тексте

ByteDance и Бэйханский университет представили UniVR — модель, обучающуюся визуальному рассуждению напрямую из пикселей, обходя текстовые абстракции.

Баннер новости 3442

Прорыв в визуальном рассуждении

Традиционные мультимодальные модели (LMMs) опираются на текстовые цепочки рассуждений, что ограничивает их понимание физической реальности. Исследователи из ByteDance и Пекинского университета транспорта представили UniVR — первую архитектуру, способную обучаться сложному планированию и физическим динамическим процессам исключительно на основе визуальных демонстраций. В основе подхода лежит идея, что человеческий мозг способен моделировать сценарии в уме без слов, и ИИ может повторить этот путь.

Архитектура и VR-GRPO

Базовой моделью выступает Emu3.5 (34 млрд параметров), но ключевое нововведение — алгоритм обучения VR-GRPO. Он использует два типа наград:

  • Глобальная награда (Global Reward): Оценка завершения задачи и качества изображения через VLM-оценщик.
  • Шаговая награда (Step-Focal Reward): Выявление моментов наибольшей неопределенности в траектории рассуждения. Алгоритм анализирует дисперсию между разными траекториями (через CLIP-эмбеддинги) и фокусирует внимание модели на самых «ошибочных» шагах.

Формула итоговой награды: R_reason = R_global - λ|R_global - R_step. Это предотвращает «ленивые» решения и обеспечивает физическую согласованность действий.

Бенчмарк VR-X: 1.5 млн сэмплов

Для обучения и оценки создан датасет VR-X, собранный из 16 источников (включая AgiBot, Action100M, EgoDex). Он содержит 310k образцов для обучения с холодным стартом, 3k для RL-дообучения и 1.8k для тестирования. Задачи охватывают:

  • Долгосрочное планирование (робототехника, готовка).
  • Пространственные головоломки.
  • Визуальный поиск и манипуляции.

Результаты: Обгон гигантов

UniVR демонстрирует выдающиеся результаты на бенчмарке VR-X, значительно превосходя базовую модель Emu3.5 и конкурируя с закрытыми моделями уровня GPT-5 и Gemini 3 Pro. Ниже приведено сравнение ключевых метрик (чем ниже JEPA, тем лучше, остальные — процент успеха):

Метод Guidance Robot Editing Spatial Puzzle Search Overall↑ JEPA↓
Emu3.5 (Base) 38.6 42.8 32.7 35.3 43.4 46.2 39.8 33.62
UniVR (34B) 59.5 68.0 48.5 46.5 62.2 64.3 58.2 13.01
GPT-5 68.2 64.1 58.0 49.3 64.0 77.4 63.5 12.17
Gemini-3-pro 66.2 67.1 63.7 55.1 65.5 79.0 66.1 11.07

UniVR улучшает общие показатели на +18.4% относительно базовой модели. Примечательно, что при 34 млрд параметров она приближается к производительности пайплайна Gemini 3 Pro + Nano Banana 2 и превосходит Gemini 3 в задачах долгосрочного манипулирования.

Влияние на мультимодальное понимание

Обучение в визуальном пространстве не только улучшает планирование, но и повышает общую способность к пониманию изображений. На бенчмарке MMMU UniVR достигает 0.337 (против 0.292 у Emu3.5), а на MME(P) — 799.3 (против 781.1). Все код, данные и модели будут открыты для сообщества.

Бенчмарки

БенчмаркUniVREmu 3.5Emu3.5GPT-5Gemini-3-pro
VR-X Overall13.01%33.62%12.17%11.07%
MMMU0.337score0.292score
MME(P)799.3score781.1score
MME(C)338.5score324.6score
MMBench0.1score0.183score
MathVista41.7%41.7%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Github ↗