Главная/Блог/Аналитика/NVIDIA Alpamayo 2 Super: Открытая…
Аналитика4 мин чтения · 5 августа 2026 г.

NVIDIA Alpamayo 2 Super: Открытая VLA-модель для автономного вождения

NVIDIA представила модель Alpamayo 2 Super с 34 млрд параметров, способную не только планировать траекторию, но и объяснять причины решений. Разбираем архитектуру, данные и практическое применение.

NVIDIA Alpamayo 2 Super: Открытая VLA-модель для автономного вождения

Автономное вождение долгое время страдало от так называемых «длинных хвостов» (long-tail events) — редких, но критически важных ситуаций на дороге, которые традиционные системы обнаружения и предсказания обрабатывают с низкой точностью. Именно на решение этой проблемы направлена новая разработка NVIDIA — модель Alpamayo 2 Super. Это не просто еще один алгоритм компьютерного зрения, а полноценная Vision-Language-Action (VLA) архитектура, объединяющая понимание визуальной среды, языковое моделирование и физическое действие в единый конвейер.

Что делает эту публикацию особенной, так это ее открытость. NVIDIA выпустила веса модели под лицензией OpenMDW-1.1, что позволяет коммерческое использование с первого дня без дополнительных разрешений. Модель способна за один проход через видеопоток со всех камер генерировать не только план движения, но и причинно-следственное объяснение этого плана. Это прорыв в области интерпретируемости ИИ, который становится все более важным для сертификации автономных систем.

В этой статье мы подробно разберем архитектуру Alpamayo 2 Super, источники данных, на которых она обучалась, результаты бенчмарков и то, как разработчики могут интегрировать эту модель в свои продукты. Мы также рассмотрим технические детали инференса и перспективы масштабирования.

01Архитектура: Гибрид VLM и диффузионного декодера

Сердцем Alpamayo 2 Super является гибридная архитектура, состоящая из двух основных компонентов. Первый — это 32-миллиардная языково-визуальная модель (VLM) на базе NVIDIA Cosmos 3 Super Reasoner. Этот бэкбоун отвечает за глубокое понимание сцены: он анализирует видеопоток, извлекает семантические признаки и формирует внутреннее представление о состоянии окружающей среды. Второй компонент — 2.3-миллиардный диффузионный декодер действий, который преобразует это абстрактное представление в конкретные физические команды.

NVIDIA Alpamayo 2 Super: Открытая VLA-модель для автономного вождения

Такая разделение задач позволяет модели использовать мощь больших языковых моделей для рассуждения, сохраняя при этом эффективность и точность специализированных декодеров для генерации траекторий. Диффузионный подход в декодере действий особенно важен, так как он позволяет модели генерировать плавные, многовариантные траектории, учитывая неопределенность в окружающей среде.

Модель обрабатывает входные данные в виде многокамерного RGB-видео, текстовых инструкций и истории эго-движения (egomotion) с временными метками. Валидированные публичные ноутбуки используют данные с шести камер и четыре исторических кадра для каждой камеры. Эго-движение представлено в виде 3D-вектора трансляции и матрицы поворота 3x3, что позволяет модели точно понимать свое положение и ориентацию в пространстве на нескольких временных шагах.

02Обучение на гигантских объемах данных

Качество модели напрямую зависит от качества и объема данных, на которых она обучалась. NVIDIA заявляет, что Alpamayo 2 Super была обучена на примерно 115 000 часов многокамерного видео вождения, аннотированного данными об эго-движении и траекториях. Это колоссальный объем данных, который охватывает разнообразные сценарии, от городских улиц до загородных шоссе, в различных погодных условиях и в разное время суток.

NVIDIA Alpamayo 2 Super: Открытая VLA-модель для автономного вождения

Особое внимание уделено обучению причинно-следственным связям. В набор данных включено около 3,7 миллиона трасс Chain-of-Causation (CoC). CoC — это структурированные, причинно связанные объяснения решений водителя (или ИИ). Например, если автомобиль тормозит, CoC объясняет, почему это произошло: «Торможение вызвано приближающимся пешеходом на пешеходном переходе, который начал движение». Такие данные позволяют модели не просто запоминать паттерны, но и понимать логику принятия решений.

Кроме того, тренировочные данные включают более одного миллиарда изображений. Это обеспечивает модели богатое визуальное представление мира, позволяя ей распознавать объекты и сцены с высокой точностью даже в сложных условиях.

💡
Почему это важно. Традиционные модели автономного вождения часто работают как «черные ящики»: они выдают траекторию, но не объясняют, почему она была выбрана. Alpamayo 2 Super генерирует CoC-трассы, что делает процесс принятия решений прозрачным и проверяемым. Это критически важно для безопасности и сертификации автономных систем.

03Выходные данные: Пять функций в одном проходе

Одной из ключевых особенностей Alpamayo 2 Super является ее способность генерировать пять различных типов выходных данных за один проход через видеопоток. Это значительно упрощает архитектуру автономных систем и снижает вычислительные затраты.

  1. Планируемая траектория: API траектории возвращает 64 точки пути, охватывающие интервал от 0.1 до 6.4 секунд с шагом 0.1 секунды. Каждая точка содержит координаты XYZ в системе координат автомобиля и матрицу поворота 3x3. Это позволяет системе точно знать, куда и как она будет двигаться в ближайшем будущем.
  2. Причинно-следственное объяснение (CoC trace): Модель генерирует текстовое объяснение, почему была выбрана данная траектория. Это объяснение интегрируется с рабочими процессами безопасности NVIDIA Halos и поддерживает соответствие стандартам AI safety, таким как ISO/PAS 8800.
  3. Мета-действие: Модель определяет высокоуровневое действие, такое как «уступить дорогу», «сменить полосу» или «остановиться». Это помогает другим компонентам системы быстро понять намерения ИИ.
  4. Автоматическая аннотация: Модель может использоваться как автолейблер для собственных данных флота. NVIDIA заявляет, что это сжимает циклы аннотации с месяцев до дней, что значительно ускоряет разработку и улучшение моделей.
  5. Визуальный вопросно-ответный ответ с 2D-привязкой (VQA): Модель может отв

    Источник: MarkTechPost ↗