Архитектура и лицензирование
Alpamayo 2 Super — это Vision-Language-Action (VLA) модель с 34 миллиардами параметров, разработанная для решения проблемы «длинного хвоста» (редких и сложных многоагентных ситуаций) в автономном вождении. Архитектура состоит из двух основных компонентов:
- 32B VLM backbone: Построен на базе NVIDIA Cosmos 3 Super Reasoner и дообучен с использованием reinforcement learning.
- 2.3B Action Decoder: Диффузионный декодер действий.
Веса модели опубликованы под лицензией OpenMDW-1.1 (Linux Foundation), что разрешает коммерческое использование, дообучение и создание производных моделей без дополнительных разрешений. Исходный код распространяется под лицензией Apache 2.0.
Входные данные и выходные результаты
Модель обрабатывает многокамерное RGB-видео, текстовые запросы и историю эго-движения (3D-трансляция и матрица поворота 3×3). На основе одного прохода через видео с шести камер (с четырьмя историческими кадрами на каждую) модель генерирует пять ключевых выходов:
- Планируемая траектория (64 точки на 6.4 секунд).
- Причинно-следственное объяснение (Chain-of-Causation, CoC).
- Мета-действие (например, «уступить дорогу» или «сменить полосу»).
- Автоматические аннотации для обучения.
- Визуальный вопросно-ответный ответ с 2D-привязкой (VQA).
Данные для обучения
Модель обучена на огромном наборе данных, включающем:
- ~115 000 часов многокамерного видео с аннотациями траекторий.
- Более 1 миллиарда изображений.
- ~3.7 миллиона трасс Chain-of-Causation (структурированных объяснений решений водителя).
Результаты бенчмарков
Alpamayo 2 Super демонстрирует выдающиеся результаты в сравнении с крупными коммерческими моделями. Ниже приведены ключевые метрики:
| Бенчмарк / Метрика | Результат Alpamayo 2 Super | Сравнение / Примечание |
|---|---|---|
| LingoQA (Lingo-Judge) | 79.2 | 1-е место среди ~40 моделей. +17.0 очков против Qwen2.5-VL 72B, +15.1 против Gemini 2.5 Pro, +23.2 против GPT-4o. |
| AlpaSim (Closed-loop) | 1.50 ± 0.13 | Оценка на 910 сценариях из PhysicalAI-AV-NuRec. |
| minADE₆ (Open-loop) | 0.911m | На 937 сложных выборках из PhysicalAI-AV (прогноз на 6.4 сек). |
Практическое применение и требования
Модель интегрируется с платформой безопасности NVIDIA Halos для валидации, соответствующей стандарту ISO/PAS 8800. Использование модели в качестве автолейблера сокращает цикл аннотации данных с месяцев до дней. Для облачного тестирования требуется одна GPU NVIDIA H100 80GB (пиковое потребление памяти 72,115 MiB), при этом для инференса в автомобиле рекомендуется дистилляция модели.
Бенчмарки
| Бенчмарк | Alpamayo 2 Super | GPT-4o | Gemini 2.5 Pro | Qwen2.5-VL 72B |
|---|---|---|---|---|
| LingoQA (Lingo-Judge) | 79.2% | 56% | 64.1% | 62.2% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
