Автоматизация обучения: от 54% к 93% за 24 часа
NVIDIA опубликовала результаты интеграции фундаментальной модели Cosmos 3 с библиотекой NVIDIA TAO для автоматизации пост-обучения (post-training). Ключевое достижение — повышение точности (exact-match accuracy) на датасете Woven Traffic Safety (WTS) (задача видео-вопрос-ответ) с базового уровня 54.41% до 93.35%.
Этот результат достигнут менее чем за один день работы автономного AI-агента (на базе Codex), который самостоятельно управлял подготовкой данных, настройкой гиперпараметров через TAO AutoML и запуском обучения. Традиционный процесс настройки таких моделей занимал бы дни ручного труда инженеров.
Архитектура Cosmos 3: разделение на Reasoner и Generator
Модель Cosmos 3 построена на архитектуре Mixture-of-Transformers (MoT), которая разделяет задачи на два пути:
- Reasoner Tower (Autoregressive Transformer): Отвечает за понимание, логику и планирование. Именно эта часть подвергалась пост-обучению в данном эксперименте.
- Generator Tower (Diffusion Transformer): Отвечает за генерацию видео и предсказание состояний мира.
Такая архитектура позволяет оптимизировать модель под конкретные домены (например, безопасность дорожного движения), не затрагивая общие способности к генерации, что критично для сохранения качества модели.
Почему LoRA, а не полное дообучение?
Для адаптации модели Cosmos 3 Nano (16B параметров) NVIDIA выбрала метод Low-Rank Adaptation (LoRA). В отличие от полного дообучения (Full-Parameter SFT), LoRA замораживает веса базовой модели и обучает только матрицы низкого ранга. Это дало следующие преимущества:
- Экономия ресурсов: Требуется в ~7 раз меньше GPU-часов по сравнению с SFT.
- Скорость итераций: Позволяет быстро тестировать гипотезы и конфигурации.
- Сохранение знаний: Меньший риск «забывания» общих знаний модели (catastrophic forgetting).
Сравнение методов и результатов
Ниже приведена сводка эффективности различных подходов к пост-обучению в контексте данного кейса:
| Метод / Параметр | Базовый уровень (Zero-shot) | С LoRA (одна итерация) | С LoRA + TAO AutoML | Ресурсоемкость |
|---|---|---|---|---|
| Точность (WTS Dataset) | 54.41% | 87.14% | 93.35% | — |
| Время настройки | — | — | ~1 день (автоматизировано) | Минимальное |
| GPU-часы (относительно) | — | — | — | ~7x меньше, чем SFT |
| Роль AI-агента | Нет | Нет | Полная автоматизация (данные, конфиги, запуск) | — |
Деплой через Cosmos 3 Reasoner NIM
После обучения адаптеры LoRA могут быть развернуты с помощью Cosmos 3 Reasoner NIM. Это микросервис NVIDIA, который предоставляет OpenAI-совместимые эндпоинты. Это устраняет необходимость в сложной настройке инфраструктуры и управлении зависимостями CUDA для конечных пользователей, позволяя сразу использовать дообученную модель в продакшене.
Как это работает технически
Процесс запускается через TAO Agent Skills. AI-агент (например, Codex или Claude) получает естественные языковые инструкции, после чего:
- Автоматически загружает и обрабатывает датасет (в примере использовался WTS от Toyota).
- Генерирует конфигурационные файлы для обучения.
- Запускает контейнеры с TAO.
- Использует TAO AutoML для автоматического поиска оптимальных гиперпараметров (learning rate, rank size и др.).
Для воспроизведения требуется установка TAO skills и наличие ключей доступа к Hugging Face, NGC и LLM-провайдеру для AutoML.
Бенчмарки
| Бенчмарк | NVIDIA Cosmos 3 Nano (LoRA + AutoML) | NVIDIA Cosmos 3 Nano (LoRA) | NVIDIA Cosmos 3 Nano (baseline) |
|---|---|---|---|
| Woven Traffic Safety | 93.35% | 87.14% | 54.41% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: NVIDIA dev blog ↗
