Релиз модели14 июля 2026 г., 19:31 МСК🤖 Auto

NVIDIA Cosmos 3: до 93.35% точности за 1 день с TAO и LoRA

NVIDIA представила метод пост-обучения модели Cosmos 3 Nano с помощью TAO Agent Skills и LoRA, повысив точность видео-анализа с 54% до 93% за один день без ручного вмешательства.

Баннер новости 3559

Автоматизация обучения: от 54% к 93% за 24 часа

NVIDIA опубликовала результаты интеграции фундаментальной модели Cosmos 3 с библиотекой NVIDIA TAO для автоматизации пост-обучения (post-training). Ключевое достижение — повышение точности (exact-match accuracy) на датасете Woven Traffic Safety (WTS) (задача видео-вопрос-ответ) с базового уровня 54.41% до 93.35%.

Этот результат достигнут менее чем за один день работы автономного AI-агента (на базе Codex), который самостоятельно управлял подготовкой данных, настройкой гиперпараметров через TAO AutoML и запуском обучения. Традиционный процесс настройки таких моделей занимал бы дни ручного труда инженеров.

Архитектура Cosmos 3: разделение на Reasoner и Generator

Модель Cosmos 3 построена на архитектуре Mixture-of-Transformers (MoT), которая разделяет задачи на два пути:

  • Reasoner Tower (Autoregressive Transformer): Отвечает за понимание, логику и планирование. Именно эта часть подвергалась пост-обучению в данном эксперименте.
  • Generator Tower (Diffusion Transformer): Отвечает за генерацию видео и предсказание состояний мира.

Такая архитектура позволяет оптимизировать модель под конкретные домены (например, безопасность дорожного движения), не затрагивая общие способности к генерации, что критично для сохранения качества модели.

Почему LoRA, а не полное дообучение?

Для адаптации модели Cosmos 3 Nano (16B параметров) NVIDIA выбрала метод Low-Rank Adaptation (LoRA). В отличие от полного дообучения (Full-Parameter SFT), LoRA замораживает веса базовой модели и обучает только матрицы низкого ранга. Это дало следующие преимущества:

  • Экономия ресурсов: Требуется в ~7 раз меньше GPU-часов по сравнению с SFT.
  • Скорость итераций: Позволяет быстро тестировать гипотезы и конфигурации.
  • Сохранение знаний: Меньший риск «забывания» общих знаний модели (catastrophic forgetting).

Сравнение методов и результатов

Ниже приведена сводка эффективности различных подходов к пост-обучению в контексте данного кейса:

Метод / Параметр Базовый уровень (Zero-shot) С LoRA (одна итерация) С LoRA + TAO AutoML Ресурсоемкость
Точность (WTS Dataset) 54.41% 87.14% 93.35%
Время настройки ~1 день (автоматизировано) Минимальное
GPU-часы (относительно) ~7x меньше, чем SFT
Роль AI-агента Нет Нет Полная автоматизация (данные, конфиги, запуск)

Деплой через Cosmos 3 Reasoner NIM

После обучения адаптеры LoRA могут быть развернуты с помощью Cosmos 3 Reasoner NIM. Это микросервис NVIDIA, который предоставляет OpenAI-совместимые эндпоинты. Это устраняет необходимость в сложной настройке инфраструктуры и управлении зависимостями CUDA для конечных пользователей, позволяя сразу использовать дообученную модель в продакшене.

Как это работает технически

Процесс запускается через TAO Agent Skills. AI-агент (например, Codex или Claude) получает естественные языковые инструкции, после чего:

  1. Автоматически загружает и обрабатывает датасет (в примере использовался WTS от Toyota).
  2. Генерирует конфигурационные файлы для обучения.
  3. Запускает контейнеры с TAO.
  4. Использует TAO AutoML для автоматического поиска оптимальных гиперпараметров (learning rate, rank size и др.).

Для воспроизведения требуется установка TAO skills и наличие ключей доступа к Hugging Face, NGC и LLM-провайдеру для AutoML.

Бенчмарки

БенчмаркNVIDIA Cosmos 3 Nano (LoRA + AutoML)NVIDIA Cosmos 3 Nano (LoRA)NVIDIA Cosmos 3 Nano (baseline)
Woven Traffic Safety93.35%87.14%54.41%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: NVIDIA dev blog ↗