Релиз модели4 августа 2026 г., 18:18 МСК🤖 Auto

NVIDIA Alpamayo 2 Super: 34B VLA-модель для автономного вождения

NVIDIA представила открытую модель Alpamayo 2 Super (34 млрд параметров), объединяющую reasoning, VQA и генерацию траекторий. Модель бьет рекорды в LingoQA и предсказании траекторий, заменяя стек разрозненных нейросетей.

Баннер новости 5054

Архитектура и возможности

NVIDIA Alpamayo 2 Super — это открытая Reasoning Vision-Language-Action (VLA) модель с 34 миллиардами параметров. Архитектура объединяет 32B Cosmos 3 Super Reasoner (для анализа сцены) и 2B Action Expert (диффузионный модуль для генерации действий). Модель обучена с помощью reinforcement learning и поддерживает перцепцию 360 градусов через до 7 камер.

Ключевая инновация — единый вывод нескольких типов данных: будущих траекторий, цепочек причинно-следственных связей (Chain-of-Causation, CoC), мета-действий (например, «уступить дорогу») и ответов на вопросы с 2D-привязкой к объектам.

Результаты бенчмарков

Модель демонстрирует state-of-the-art результаты, значительно опережая конкурентов, включая GPT-4o и Gemini 2.5 Pro, в задачах понимания сцены. Ниже приведены ключевые метрики:

Метрика / Бенчмарк Результат Alpamayo 2 Super Сравнение / Примечание
minADE_6 (Траектории) 0.911 м Лучший результат на Physical AI AV Dataset (1434 сэмплов)
LingoQA (Вопросы к сцене) 79.2 1-е место среди 37 моделей. +17.0 к Qwen2.5-VL (72B), +23.2 к GPT-4o
AV Reasoning 0.433 Высокий балл на Physical AI AV Reasoning Benchmark
Meta-action IoU (поперечное) 74.59 Точность предсказания маневров
Meta-action IoU (продольное) 61.91 Точность предсказания скорости/торможения
2D Grounding IoU 0.71 Точность локализации объектов в ответе
AlpaSim Score (Closed-loop) 1.50 ± 0.13 Результат в симуляции с реактивными агентами

Почему это важно для индустрии

Разработка автономных транспортных средств (AV) ранее требовала поддержки множества разрозненных моделей: одна для траекторий, другая для понимания сцены, третья для разметки данных. Alpamayo 2 Super предлагает единый фундаментальный модуль, который может использоваться как:

  • Offline policy teacher: Обучение политик вождения на основе сгенерированных траекторий.
  • Evaluation critic: Оценка безопасности и логики решений других моделей.
  • Data engine: Автоматическая генерация аннотаций (auto-labels) и цепочек рассуждений (CoC) для кастомных датасетов.

Модель позволяет диагностировать ошибки: если траектория неверна, можно проанализировать CoC-трейс, чтобы понять, была ли причина в плохом восприятии (perception) или в ошибке планирования (reasoning).

Доступность и лицензия

Веса модели доступны на Hugging Face, а ноутбуки для инференса — на GitHub. Модель распространяется под лицензией OpenMDW-1.1 (Linux Foundation), что разрешает коммерческое использование, дообучение и создание производных моделей без дополнительных разрешений от NVIDIA. Выходные данные модели не имеют лицензионных ограничений.

Бенчмарки

БенчмаркNVIDIA Alpamayo 2 SuperGemini 2.5 ProQwen2.5-VLQwen3-VL
LingoQA79.2%64.1%62.2%72.2%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: NVIDIA dev blog ↗