Представьте себе сценарий, где автономные ИИ-агенты способны довести точность моделей зрительного восприятия (vision reasoning) выше 90% практически без участия человека. В мире разработки компьютерного зрения это звучит как мечта, но для инженеров, работающих с реальными видео-задачами, это часто становится суровой реальностью. Адаптация фундаментальных моделей к производственным задачам обычно отнимает дни, а то и недели. Разработчики тратят время на форматирование данных, настройку контейнеров, написание скриптов обучения, оценку базовых моделей и многократные проходы по гиперпараметрам, прежде чем даже узнают, улучшит ли пост-обучение точность.
Однако интеграция открытой фундаментальной модели физического ИИ NVIDIA Cosmos 3 с библиотекой NVIDIA TAO и навыками агентов (agent skills) предлагает элегантное решение этой проблемы. Эта связка позволяет полностью автоматизировать эффективное пост-обучение для задач зрительно-языкового рассуждения. Результат впечатляет: точность на датасете Woven Traffic Safety заметно выросла менее чем за один день при минимальном вмешательстве человека. В этой статье мы подробно разберем, как работает эта архитектура, почему она так эффективна и как вы можете применить этот подход в своих проектах.
01Архитектура Cosmos 3: Мозг и Тело
Чтобы понять, почему Cosmos 3 так хорошо подходит для пост-обучения, нужно заглянуть под капот его архитектуры. NVIDIA Cosmos 3 — это не просто еще одна большая языковая модель. Это омнимодальная мировая модель, которая объединяет понимание, генерацию, симуляцию и действие через общую архитектуру Mixture-of-Transformers (MoT).
Архитектура MoT разделяет способности модели на две башни (towers), что является ключевым фактором ее эффективности:
- Reasoner Tower (Башня Рассуждений): Это авторегрессионный трансформер, отвечающий за надежное рассуждение, планирование и понимание мультимодальных входных данных (текст, изображения, видео, звук). Именно эта часть модели критически важна для задач, требующих логического вывода, таких как ответ на вопросы по видео.
- Generator Tower (Башня Генерации): Это диффузионный трансформер, который предсказывает будущие состояния мира и действия. Он отвечает за генерацию видео и физических симуляций.

Эта разделение позволяет модели обрабатывать входные данные через специфические для модальностей блоки (LayerNorm и MLP), которые взаимодействуют через кросс-стрим соединения. Ключевые состояния (K_AR, V_AR) передаются в генеративный блок полного внимания, что обеспечивает контекстуальную связь между визуальной информацией и текстовыми запросами. Наличие версий модели разного размера, таких как Super 64B и Nano 16B, делает Cosmos 3 гибким выбором для различных вычислительных ограничений, при этом Nano-версия остается лидером среди открытых моделей в бенчмарках VANTAGE-Bench, PAI-Bench и Physics-IQ.
02Почему LoRA, а не полное дообучение?
Фундаментальные модели, такие как Cosmos 3, обучаются на огромных разнообразных наборах данных, усваивая общие паттерны. Однако для реального внедрения в специфические домены (например, мониторинг безопасности на дорогах или контроль качества на заводе) модели требуется специализация. Здесь встает вопрос выбора метода пост-обучения.
Обычно у разработчиков есть два пути:
- Полнопараметрическое контролируемое дообучение (Full-Parameter SFT): Этот метод обновляет все веса модели. Он необходим, если сдвиг домена колоссален или требуется структурное изменение модели. Однако он требует огромных вычислительных ресурсов и может привести к «катастрофическому забыванию» — потере общих знаний модели.
- Адаптация низкого ранга (LoRA): Этот метод замораживает веса базовой модели и внедряет обучаемые матрицы низкого ранга. LoRA идеален для быстрой итерации. В экспериментах NVIDIA использование LoRA для Cosmos 3 Nano потребовало заметно меньше GPU-часов по сравнению с полным SFT.

Именно экономия ресурсов делает LoRA идеальным выбором для быстрого прототипирования и адаптации. Вместо того чтобы переобучать миллиарды параметров, мы тонко настраиваем модель под конкретную задачу, сохраняя при этом ее общую способность к рассуждению. Это позволяет инженерам проводить эксперименты в масштабе «одного дня», а не «одного месяца».
03Автоматизация с NVIDIA TAO Agent Skills
Даже с LoRA процесс настройки остается сложным. Нужно правильно подготовить данные, настроить конфигурацию, запустить обучение и оценить результаты. Здесь на сцену выходят NVIDIA TAO Agent Skills. Это не просто библиотека команд, а набор интеллектуальных модулей, которые позволяют ИИ-агентам (например, Codex или Claude) понимать контекст задачи.
TAO Skills инкапсулируют знания, необходимые для обучения, оценки, оптимизации и развертывания моделей. Они содержат информацию о структуре конфигураций, загрузчиках данных и рабочих процессах оценки. Вместо того чтобы вручную собирать каждую команду и файл конфигурации, агент рассуждает через рабочий процесс и генерирует правильные шаги.
Важно отметить, что при использовании TAO Skills рабочий процесс автоматически обрабатывает разделение весов Reasoner и Generator. Агент гарантирует, что пост-обучение нацелено и оптимизирует только веса Reasoner для ваших downstream-задач, не затрагивая генеративную часть, что сохраняет целостность модели.
curl -fsSL https://raw.githubusercontent.com/NVIDIA-TAO/tao-skills-bank/main/scripts/install-codex-agents.sh | bash. Не забудьте экспортировать ключи Hugging Face, NGC и LLM API перед запуском.Источник: NVIDIA Developer ↗
