Архитектура и возможности
NVIDIA Alpamayo 2 Super — это открытая Reasoning Vision-Language-Action (VLA) модель с 34 миллиардами параметров. Архитектура объединяет 32B Cosmos 3 Super Reasoner (для анализа сцены) и 2B Action Expert (диффузионный модуль для генерации действий). Модель обучена с помощью reinforcement learning и поддерживает перцепцию 360 градусов через до 7 камер.
Ключевая инновация — единый вывод нескольких типов данных: будущих траекторий, цепочек причинно-следственных связей (Chain-of-Causation, CoC), мета-действий (например, «уступить дорогу») и ответов на вопросы с 2D-привязкой к объектам.
Результаты бенчмарков
Модель демонстрирует state-of-the-art результаты, значительно опережая конкурентов, включая GPT-4o и Gemini 2.5 Pro, в задачах понимания сцены. Ниже приведены ключевые метрики:
| Метрика / Бенчмарк | Результат Alpamayo 2 Super | Сравнение / Примечание |
|---|---|---|
| minADE_6 (Траектории) | 0.911 м | Лучший результат на Physical AI AV Dataset (1434 сэмплов) |
| LingoQA (Вопросы к сцене) | 79.2 | 1-е место среди 37 моделей. +17.0 к Qwen2.5-VL (72B), +23.2 к GPT-4o |
| AV Reasoning | 0.433 | Высокий балл на Physical AI AV Reasoning Benchmark |
| Meta-action IoU (поперечное) | 74.59 | Точность предсказания маневров |
| Meta-action IoU (продольное) | 61.91 | Точность предсказания скорости/торможения |
| 2D Grounding IoU | 0.71 | Точность локализации объектов в ответе |
| AlpaSim Score (Closed-loop) | 1.50 ± 0.13 | Результат в симуляции с реактивными агентами |
Почему это важно для индустрии
Разработка автономных транспортных средств (AV) ранее требовала поддержки множества разрозненных моделей: одна для траекторий, другая для понимания сцены, третья для разметки данных. Alpamayo 2 Super предлагает единый фундаментальный модуль, который может использоваться как:
- Offline policy teacher: Обучение политик вождения на основе сгенерированных траекторий.
- Evaluation critic: Оценка безопасности и логики решений других моделей.
- Data engine: Автоматическая генерация аннотаций (auto-labels) и цепочек рассуждений (CoC) для кастомных датасетов.
Модель позволяет диагностировать ошибки: если траектория неверна, можно проанализировать CoC-трейс, чтобы понять, была ли причина в плохом восприятии (perception) или в ошибке планирования (reasoning).
Доступность и лицензия
Веса модели доступны на Hugging Face, а ноутбуки для инференса — на GitHub. Модель распространяется под лицензией OpenMDW-1.1 (Linux Foundation), что разрешает коммерческое использование, дообучение и создание производных моделей без дополнительных разрешений от NVIDIA. Выходные данные модели не имеют лицензионных ограничений.
Бенчмарки
| Бенчмарк | NVIDIA Alpamayo 2 Super | Gemini 2.5 Pro | Qwen2.5-VL | Qwen3-VL |
|---|---|---|---|---|
| LingoQA | 79.2% | 64.1% | 62.2% | 72.2% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: NVIDIA dev blog ↗
