Главная/Блог/Гайд/NVIDIA Alpamayo 2 Super: Революция в…
Гайд9 мин чтения · 4 августа 2026 г.

NVIDIA Alpamayo 2 Super: Революция в автономном вождении

Разбираем новую модель NVIDIA Alpamayo 2 Super: как объединение reasoning, траекторий и мета-действий ускоряет разработку автономных автомобилей.

NVIDIA Alpamayo 2 Super: Революция в автономном вождении

Разработка автономных транспортных средств (АТС) долгое время страдала от фрагментации. Инженерам приходилось использовать разрозненные модели для предсказания траекторий, анализа сцены, генерации текстовых ответов и разметки данных. Эта разобщенность не только усложняла сравнение результатов, но и делала невозможным глубокое понимание того, как модель принимает решения. Сегодня NVIDIA представляет прорывное решение — Alpamayo 2 Super, открытую модель с 34 миллиардами параметров, которая объединяет восприятие, рассуждение и действие в единый конвейер.

Это не просто еще одна версия предыдущей модели. Alpamayo 2 Super — это фундаментальный сдвиг в парадигме разработки АТС. Она сочетает в себе мощь 32-миллиардной модели Cosmos 3 Super Reasoner и 2-миллиардного эксперта по действиям (Action Expert), обученного с помощью подкрепления (RL). Результатом стала система, способная не только предсказывать, куда поедет автомобиль, но и объяснять, почему это решение является правильным, а также генерировать высокоуровневые мета-действия. В этой статье мы подробно разберем архитектуру, возможности и практическое применение этой технологии.

Архитектура Alpamayo 2 Super: обработка мультимодальных входных данных через 32B Cosmos 3 Super Reasoner и 2B Action Expert.
Архитектура Alpamayo 2 Super: обработка мультимодальных входных данных через 32B Cosmos 3 Super Reasoner и 2B Action Expert.

01Архитектура: Объединение рассуждения и действия

Сердцем Alpamayo 2 Super является гибридная архитектура, разделенная на два ключевых компонента. Первый — это Cosmos 3 Super Reasoner объемом 32 миллиарда параметров. Эта часть модели отвечает за глубокое понимание сцены. Она обрабатывает видеопоток с до семи камер, обеспечивая круговой обзор (360 градусов), анализирует языковой контекст и историю движения. Reasoner формирует внутреннее представление ситуации, выявляя важные объекты, их намерения и контекст, который критичен для принятия решений.

Второй компонент — Action Expert объемом 2 миллиарда параметров. Это диффузионная модель, которая преобразует абстрактное внутреннее представление Reasoner в конкретные физические траектории движения автомобиля. Именно этот модуль отвечает за генерацию будущих путей движения (траекторий), учитывая динамику и ограничения окружающей среды.

Оба компонента прошли пост-обучение с использованием подкрепления (Reinforcement Learning). Это позволило модели не просто копировать данные, а оптимизировать свои решения для достижения максимальной безопасности и эффективности. Такая архитектура позволяет Alpamayo 2 Super выдавать несколько типов выходных данных одновременно: будущие траектории, цепочки причинно-следственных связей (Chain-of-Causation, CoC), высокоуровневые мета-действия, ответы на вопросы с привязкой к координатам (VQA с 2D-граундингом) и автоматические метки для разметки данных.

Пример планирования в сложной сцене с использованием Alpamayo 2 Super.
Пример планирования в сложной сцене с использованием Alpamayo 2 Super.

02Планирование и рассуждение: Что и почему

Одной из главных проблем автономного вождения является способность справляться с нестандартными ситуациями: строительные зоны, частично скрытые пешеходы, необычные взаимодействия на дороге. Простое сопоставление с шаблонами траекторий здесь не работает. Модели необходимо понимать контекст.

Alpamayo 2 Super генерирует два взаимосвязанных вывода:

  • Траектория (Trajectory): отвечает на вопрос «Что» может сделать автомобиль в следующий момент. Это конкретный путь движения.
  • Цепочка причинно-следственных связей (Chain-of-Causation, CoC): отвечает на вопрос «Почему» было принято такое решение. Это текстовое объяснение, основанное на наблюдаемом контексте сцены.

Наличие обоих выводов критически важно для отладки и валидации. Разработчики могут сравнить политику развернутого автомобиля с политикой более крупной модели-учителя, диагностировать, где произошел сбой (на этапе восприятия, рассуждения или генерации действия), и использовать эти данные для улучшения датасетов. Кроме того, CoC-трассы интегрируются в рабочие процессы безопасности NVIDIA Halos, позволяя проводить глубокую инспекцию понимания модели.

💡
Важно знать. CoC-трассы позволяют не только проверять правильность решения, но и использовать их для автоматической разметки данных (auto-labeling), что значительно ускоряет подготовку датасетов для дообучения моделей.

Пример кода: Генерация траекторий и CoC

Для работы с моделью NVIDIA предоставляет готовые ноутбуки. Ниже приведен пример основной логики инференса, где загружается датасет, подготавливаются входные данные и генерируется траектория вместе с объяснением.

terminalpython
from alpamayo2_super import helper
from alpamayo2_super.load_physical_aiavdataset import load_physical_aiavdataset
from alpamayo2_super.models.alpamayo2_super import Alpamayo2Super
from alpamayo2_super.visualization import plot_inference_result

data = load_physical_aiavdataset(
  "030c760c-ae38-49aa-9ad8-f5650a545d26",
   t0_us=2000000,
model = Alpamayo2Super.from_pretrained("nvidia/Alpamayo2-Super", dtype=torch.bfloat16, device_map="cuda:0")
model_inputs = helper.prepare_model_inputs(data, model.config, model.tokenizer)
model_inputs = helper.to_device(model_inputs, "cuda")
torch.cuda.manual_seed_all(42)
with torch.autocast("cuda", dtype=torch.bfloat16):
   pred_xyz, pred_rot, logprob, extra = model.sample_trajectories_from_data(
       data=model_inputs,
       top_p=0.98,
       temperature=0.6,
       num_traj_samples=1,
       diffusion_kwargs={"inference_step": 10},
       return_extra=True,
   )
fig, metadata = plot_inference_result(
   data=data,
   pred_xyz=pred_xyz,
   extra=extra,
Визуализация результатов инференса: траектория и цепочка рассуждений.
Визуализация результатов инференса: траектория и цепочка рассуждений.

03Оценка производительности: Открытые и замкнутые циклы

Для оценки качества модели используются два подхода: открытая (open-loop) и замкнутая (closed-loop) оценка. Каждый из них раскрывает разные аспекты работы системы.

Открытая оценка (Open-loop)

Этот метод измеряет качество траекторий и рассуждений на записанных сценах путем сравнения с эталонными данными (ground-truth). Alpamayo 2 Super демонстрирует выдающиеся результаты:

  • Предсказание траекторий: На 1434 сложных выборках из Physical AI AV Dataset модель достигла показателя minADE_6 на 6.4 секунды равным 0.911 м. Это означает высокую точность предсказания будущего положения автомобиля.
  • Рассуждение (AV Reasoning): Оценка 0.433 на Physical AI AV Reasoning Benchmark.
  • LingoQA: Модель набрала 79.2 балла, заняв первое место среди 37 оцененных моделей. Для сравнения, она опережает Qwen2.5-VL (72B) на 17.0 пунктов, Qwen3-VL (32B) на 7.0 пунктов, Gemini 2.5 Pro на 15.1 пунктов и GPT-4o на 23.2 пункта. Это подчеркивает, что даже при меньшем количестве параметров (34B против 72B у некоторых конкурентов), качество рассуждений остается на высшем уровне.

Однако у открытой оценки есть недостаток: она сравнивает предсказания с фиксированным будущим, не учитывая реакции других участников движения на действия автономного автомобиля. Например, если АТС перестраивается, открытая оценка может не учесть, как соседняя машина отреагирует на это маневр.

Замкнутая симуляция (Closed-loop)

Для решения этой проблемы используется симулятор NVIDIA AlpaSim. Он выполняет каждое предсказанное действие в сцене и учитывает реактивное поведение окружающих агентов. Это позволяет выявить столкновения, съезды с дороги и другие ошибки, которые проявляются только после того, как политика влияет на будущие наблюдения.

На 913 реконструированных сценах Alpamayo 2 Super получила оценку AlpaSim Score 1.50 ± 0.13, что превосходит предыдущую версию (Alpamayo 1.5 Nano: 1.37 ± 0.10). Ниже приведена конфигурация для запуска модели в AlpaSim.

terminalyaml
# Should be used in defaults list, e.g.
# - /driver: alpamayo2
# Type validation happens at driver runtime via OmegaConf.structured merge
defaults:
  - alpamayo_configs    # Camera and simulation configs for 4-cam 10Hz
  - _self_                      # YAML values override schema defaults
# Alpamayo 2 Super Driver Configuration for Alpasim
# Logging level (uses wizard's global setting)
log_level: ${wizard.log_level}
# Model configuration
model:
  model_type: alpamayo2  # Entry-point name in alpasim.models registry
  # HuggingFace model ID (requires cached download or hf authentication in the driver container)
  checkpoint_path: "nvidia/Alpamayo2-Super"
  # # Alternative local path to a pre-downloaded model
  # checkpoint_path: "/mnt/drivers/alpamayo2/Alpamayo2-Super"
  device: "cuda"
  # Enable classifier-free guidance navigation sampling (NOTE: this requires 2 GPUs with at least 70 GB VRAM).
  # Set to true only when sufficient GPU memory is available.
  use_classifier_free_guidance_nav: false
# Server configuration
host: "0.0.0.0"
port: ???
# Inference configuration
inference:
  use_cameras:
     - camera_cross_left_120fov
     - camera_front_wide_120fov
     - camera_cross_right_120fov
     - camera_front_tele_30fov
  max_batch_size: 1  # A2Super is memory intensive, start with batch size 1
  subsample_factor: 1
  context_length: 4  # A2Super uses 4 temporal frames per camera
# Route configuration — A2Super uses language-only navigation, not waypoint commands
route:
  use_waypoint_commands: false
# Output configuration
output_dir: "/mnt/output/driver"
# Trajectory optimization (disabled by default for A2Super)
trajectory_optimizer:
  enabled: false
plot_debug_images: false

04Мета-действия: От траектории к намерению

Траектория точна, но она не всегда дает компактное описание намерения водителя. Здесь на помощь приходят мета-действия (meta-actions). Это высокоуровневые решения, такие как «уступить», «перестроиться», «остановиться» или «ускориться».

Мета-действия служат мостом между end-to-end фундаментальной моделью и модульным стеком АТС. Потоковый планировщик может использовать это решение, оценщик может проверить, согласуется ли геометрия траектории с заявленным намерением, а команды могут искать в базе данных конкретные маневры.

Для оценки точности мета-действий используется метрика Intersection-over-Union (IoU) для трех компонентов таксономии: латерального (бокового), лонгитудинального (продольного) и полосового (lane-wise). На внутреннем наборе из 94 000 клипов с эталонными данными Alpamayo 2 Super достигла следующих результатов:

  • Латеральный IoU: 74.59
  • Лонгитудинальный IoU: 61.91
  • Полосовой IoU: 73.55

Код для генерации мета-действий выглядит следующим образом:

terminalpython
from alpamayo2_super import helper
from alpamayo2_super.load_physical_aiavdataset import load_physical_aiavdataset
from alpamayo2_super.models.alpamayo2_super import Alpamayo2Super
from alpamayo2_super.text_tasks import generate_text, prepare_text_generation_inputs

data = load_physical_aiavdataset(
  "030c760c-ae38-49aa-9ad8-f5650a545d26",
   t0_us=2000000,
model = Alpamayo2Super.from_pretrained("nvidia/Alpamayo2-Super", dtype=torch.bfloat16, device_map="cuda:0")
task_inputs = prepare_text_generation_inputs(
   data=data,
   model_config=model.config,
   tokenizer=model.tokenizer,
   task="meta_action",
task_inputs = helper.to_device(task_inputs, "cuda")
torch.cuda.manual_seed_all(42)
with torch.autocast("cuda", dtype=torch.bfloat16):
   result = generate_text(
       model,
       task_inputs,
       top_p=0.98,
       temperature=0.6,
       max_new_tokens=512,
   )
cot = result["cot"][0]
meta_action = result["meta_action"][0]
print("Chain-of-Causation:\n", cot)
print("\nMeta-action:\n", meta_action)
Пример вывода мета-действия для соответствующей сцены.
Пример вывода мета-действия для соответствующей сцены.

05Понимание сцены: VQA и 2D-граундинг

Планирование — лишь одна из функций модели. Визуальные вопросы и ответы (Visual Question Answering, VQA) позволяют разработчикам напрямую взаимодействовать с моделью через естественный язык. Можно спросить о ключевых элементах сцены, о том, как они влияют на поведение, или почему автомобиль должен замедлиться.

Alpamayo 2 Super не только дает текстовый ответ, но и локализует упомянутые объекты, предсказывая 2D-ограничивающие рамки (bounding boxes) в соответствующих кадрах камер. Это делает выводы гораздо более полезными, чем просто свободный текст. Рецензенты могут проверить, к какому именно объекту относится модель, а автоматические проверки могут выявить пропущенные или несоответствующие рамки.

📌
Факт. Благодаря круговому обзору (до 7 камер), модель может отвечать на вопросы, касающиеся бокового и заднего контекста, который часто упускается моделями, использующими только фронтальные камеры.
Схема работы Cosmos Reason VLM в контексте Alpamayo 2 Super.
Схема работы Cosmos Reason VLM в контексте Alpamayo 2 Super.

06Что это значит на практике

Появление Alpamayo 2 Super меняет ландшафт разработки автономного вождения. Вместо поддержки десятков разрозненных моделей для разных задач, инженеры получают единый фундаментальный инструмент. Эта модель может использоваться как учитель для офлайн-политик, как критик для оценки, как движок для создания данных (data curation) и как стартовая точка для кастомизации под новые задачи.

Открытая лицензия OpenMDW-1.1 позволяет свободно использовать модель, дообучать ее и коммерциализировать производные модели без дополнительных разрешений от NVIDIA. Это снижает барьеры для входа и стимулирует инновации. Для разработчиков из России доступ к весам модели осуществляется через Hugging Face, а ноутбуки для инференса доступны на GitHub. Локальный запуск требует мощных GPU (рекомендуется 2 GPU с 70+ GB VRAM для некоторых режимов), что делает технологию доступной для крупных исследовательских центров и компаний с соответствующей инфраструктурой.

Alpamayo 2 Super демонстрирует, что будущее автономного вождения лежит не просто в увеличении параметров, а в интеграции глубокого рассуждения, точного планирования и понятного объяснения решений в единую систему.

Источник: NVIDIA Developer ↗