Прорыв в визуальном рассуждении
Традиционные мультимодальные модели (LMMs) опираются на текстовые цепочки рассуждений, что ограничивает их понимание физической реальности. Исследователи из ByteDance и Пекинского университета транспорта представили UniVR — первую архитектуру, способную обучаться сложному планированию и физическим динамическим процессам исключительно на основе визуальных демонстраций. В основе подхода лежит идея, что человеческий мозг способен моделировать сценарии в уме без слов, и ИИ может повторить этот путь.
Архитектура и VR-GRPO
Базовой моделью выступает Emu3.5 (34 млрд параметров), но ключевое нововведение — алгоритм обучения VR-GRPO. Он использует два типа наград:
- Глобальная награда (Global Reward): Оценка завершения задачи и качества изображения через VLM-оценщик.
- Шаговая награда (Step-Focal Reward): Выявление моментов наибольшей неопределенности в траектории рассуждения. Алгоритм анализирует дисперсию между разными траекториями (через CLIP-эмбеддинги) и фокусирует внимание модели на самых «ошибочных» шагах.
Формула итоговой награды: R_reason = R_global - λ|R_global - R_step. Это предотвращает «ленивые» решения и обеспечивает физическую согласованность действий.
Бенчмарк VR-X: 1.5 млн сэмплов
Для обучения и оценки создан датасет VR-X, собранный из 16 источников (включая AgiBot, Action100M, EgoDex). Он содержит 310k образцов для обучения с холодным стартом, 3k для RL-дообучения и 1.8k для тестирования. Задачи охватывают:
- Долгосрочное планирование (робототехника, готовка).
- Пространственные головоломки.
- Визуальный поиск и манипуляции.
Результаты: Обгон гигантов
UniVR демонстрирует выдающиеся результаты на бенчмарке VR-X, значительно превосходя базовую модель Emu3.5 и конкурируя с закрытыми моделями уровня GPT-5 и Gemini 3 Pro. Ниже приведено сравнение ключевых метрик (чем ниже JEPA, тем лучше, остальные — процент успеха):
| Метод | Guidance | Robot | Editing | Spatial | Puzzle | Search | Overall↑ | JEPA↓ |
|---|---|---|---|---|---|---|---|---|
| Emu3.5 (Base) | 38.6 | 42.8 | 32.7 | 35.3 | 43.4 | 46.2 | 39.8 | 33.62 |
| UniVR (34B) | 59.5 | 68.0 | 48.5 | 46.5 | 62.2 | 64.3 | 58.2 | 13.01 |
| GPT-5 | 68.2 | 64.1 | 58.0 | 49.3 | 64.0 | 77.4 | 63.5 | 12.17 |
| Gemini-3-pro | 66.2 | 67.1 | 63.7 | 55.1 | 65.5 | 79.0 | 66.1 | 11.07 |
UniVR улучшает общие показатели на +18.4% относительно базовой модели. Примечательно, что при 34 млрд параметров она приближается к производительности пайплайна Gemini 3 Pro + Nano Banana 2 и превосходит Gemini 3 в задачах долгосрочного манипулирования.
Влияние на мультимодальное понимание
Обучение в визуальном пространстве не только улучшает планирование, но и повышает общую способность к пониманию изображений. На бенчмарке MMMU UniVR достигает 0.337 (против 0.292 у Emu3.5), а на MME(P) — 799.3 (против 781.1). Все код, данные и модели будут открыты для сообщества.
Бенчмарки
| Бенчмарк | UniVR | Emu 3.5 | Emu3.5 | GPT-5 | Gemini-3-pro |
|---|---|---|---|---|---|
| VR-X Overall | 13.01% | — | 33.62% | 12.17% | 11.07% |
| MMMU | 0.337score | 0.292score | — | — | — |
| MME(P) | 799.3score | 781.1score | — | — | — |
| MME(C) | 338.5score | 324.6score | — | — | — |
| MMBench | 0.1score | 0.183score | — | — | — |
| MathVista | 41.7% | 41.7% | — | — | — |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Github ↗
