В мире искусственного интеллекта грань между мощными облачными кластерами и автономными устройствами всегда была сложной для преодоления. Роботы, дроны и умные камеры часто сталкиваются с жесткими ограничениями по памяти и вычислительной мощности, что делает невозможным запуск крупных языковых моделей (LLM) или сложных визуальных моделей напрямую на устройстве. Однако NVIDIA, один из главных архитекторов современного ИИ, недавно сделала шаг, который может изменить правила игры. Компания выпустила Cosmos 3 Edge — новую открытую модель мира (World Model), разработанную специально для работы непосредственно на edge-устройствах.
Это не просто еще одна оптимизированная нейросеть. Cosmos 3 Edge — это фундаментальный сдвиг в парадигме «физического ИИ» (Physical AI). Модель способна не только понимать окружающую среду через камеру, но и рассуждать о ней в реальном времени, предсказывать последствия действий и генерировать управляющие сигналы для роботов прямо на месте, без задержек, связанных с передачей данных в облако. Это открывает двери для создания по-настоящему автономных систем в фабриках, складах и больницах, где надежность и скорость критически важны.
01Что такое Cosmos 3 и почему важен Edge-формат?
Чтобы понять значимость Cosmos 3 Edge, нужно взглянуть на семейство моделей, которое она представляет. Линейка Cosmos 3, представленная на конференции GTC Taipei 31 мая 2026 года, включает в себя несколько уровней. Если Super-версия предназначена для мощных дата-центров, то Edge-версия заметно меньше по размеру, что делает её идеальной для встраиваемых систем.
Проблема, которую решает Cosmos 3 Edge, специфична и остра. Машины, работающие на периферии сети (edge), такие как промышленные роботы-манипуляторы, автономные погрузчики или медицинские дроны, часто работают в условиях ограниченной памяти и вычислительных ресурсов. Им требуется производительность уровня дата-центра, но в формате, который помещается в компактный модуль. Cosmos 3 Edge закрывает этот разрыв, предоставляя возможность запускать сложные модели мира локально.
02Архитектура: Два трансформера, одно представление
Сердцем Cosmos 3 является инновационная архитектура Mixture-of-Transformers (Смесь Трансформеров). В отличие от стандартных моделей, которые могут обрабатывать только текст или только изображения, Cosmos 3 использует две отдельные башни (towers), которые работают в тесной связке через общие слои мультимодального внимания.

Первая башня — авторегрессионная (autoregressive tower) — отвечает за понимание и рассуждение. Она обрабатывает токены зрения и текста, позволяя модели «думать» о сцене, анализировать контекст и строить логические цепочки. Вторая башня — диффузионная (diffusion tower) — занимается предсказанием, генерацией и нейросимуляцией. Она работает с токенами зрения, аудио и действий, создавая визуальные и физические симуляции будущего.
Ключевой момент здесь — разделение слоев нормализации и многослойных перцептронов (MLP) при сохранении общих слоев внимания. Это позволяет модели выравнивать информацию между языком, видео, аудио и действиями. Например, когда робот видит объект, авторегрессионная башня может сгенерировать текстовое описание ситуации («объект скользкий»), а диффузионная башня предскажет, как изменится видео, если робот попытается его схватить. Паттерны внимания также адаптируются: для языка используется каузальное внимание (каждый токен обращается к предыдущим), а для диффузионных токенов — более широкое внимание к контексту, что поддерживает согласованность предсказаний.
03Единое представление действий для разных роботов
Одной из самых больших проблем в робототехнике является гетерогенность. Автомобиль описывает свои движения через эго-позицию и скорость. Камера — через движение объектива. Роботизированная рука — через положение конечного эффектора, а захват — через состояние клешни. Раньше для каждого типа устройства требовалась своя модель или сложная конвертация данных.
Cosmos 3 Edge решает эту проблему, маппируя все эти различные «воплощения» (embodiments) в единое представление действий. Действия кодируются как компактные геометрические векторы, которые захватывают трансляцию, вращение и состояние манипуляции. Это создает прямую связь между контролем и визуальной структурой мира. Модель ассоциирует изменения пикселей с физическим движением и входными сигналами управления. Сгенерированное видео становится не просто предсказанием, а визуализацией того, как мир должен измениться в ответ на действие.

Поддерживаемые размерности действий зависят от типа устройства. Согласно документации на GitHub, модель поддерживает:
- Движение камеры
- Автономные транспортные средства
- Эгоцентрическое движение
- Одноплечевой робот
- Двухплечевой робот
- Человекоподобный робот
04Режим политики: Двустороннее взаимодействие
В режиме политики (Policy mode) Cosmos 3 Edge работает в двух направлениях. С одной стороны, она предсказывает действие вместе с его ожидаемым визуальным последствием. Текущее состояние поступает на вход, а на выходе мы получаем предполагаемое действие и его вероятный визуальный результат. С другой стороны, модель может инвертировать этот процесс: зная эффект (например, объект упал), она может вывести, какое действие его вызвало.
Это
Источник: MarkTechPost ↗
