Релиз модели6 октября 2026 г., 11:18 МСК🤖 Auto

Reka Rho-1: 19B-модель, объединяющая текст, видео и управление роботами

Reka представила Rho-1 — первую омни-модель на 19 млрд параметров, способную в едином контекстном окне понимать, генерировать видео и выдавать команды для роботов, устраняя необходимость в многоступенчатых пайплайнах.

Баннер новости 9019

Архитектура без посредников

Reka выпустила исследовательскую версию модели Rho-1, обученную с нуля. В отличие от типичных мультимодальных систем, где задачи передаются от одной специализированной модели к другой (что создает задержки), Rho-1 использует единый нейросетевой блок. Текст, изображения, видео и действия робота представлены как токены в одном окне контекста. Модель способна нарисовать маяк, выделить его рамкой, анимировать, изменить фон на снежную бурю и объяснить разницу за 5 шагов без вызова внешних инструментов.

Двухпоточный дизайн и KV Cache

Ключевая инновация — использование двух потоков экспертов в каждом блоке трансформера, разделяющих единый KV Cache:

  • Поток понимания: обрабатывает язык и визуальный парсинг (дискретные токены).
  • Поток генерации: декодирует латенты в изображения и видео (непрерывные токены).

При необходимости вывода пикселей поток понимания отправляет дискретный токен-переключатель, после чего поток генерации рендерит результат на основе накопленного состояния. Это позволяет выдавать координаты bounding box как токены, а не через отдельный детектор, и переиспользовать представления кадров видео без повторного кодирования.

Скорость и дистилляция

Базовая модель генерирует видео со скоростью 0.79x от реального времени (медиана), с первым клипом через ~6 секунд. Однако основная ценность — в дистиллированной версии, где количество шагов денормализации сокращено с 99 до 8. Это позволяет генерировать 5.3-секундный клип примерно за 1 секунду, что сопоставимо с fastest dedicated image models во внутренних тестах Reka.

Сравнение с конкурентами

Rho-1 выделяется нативной поддержкой действий роботов и непрерывного видео, чего нет у многих аналогов. Ниже приведено сравнение ключевых характеристик:

d>Открытые веса
Характеристика Reka Rho-1 ByteDance BAGEL BAAI Emu3.5 Google Genie 3
Параметры 19B 14B (7B active MoT) 34B Не раскрыто
Входы Текст, изображение, видео, действия, проприоцепция Текст, изображение Чередующийся текст и изображение Текст, навигация
Выходы Текст, изображение, видео, действия, проприоцепция Текст, изображение Чередующийся текст и изображение Интерактивное видео
Нативное видео Да (до 672×384) Нет Нет (кадры, не клипы) Да (720p, 24 fps)
Управление роботами Да (непрерывные токены действий) Нет Демонстрации манипуляции Навигационные действия
Нет (Research Preview) Да (Apache 2.0) Да (Apache 2.0) Нет

Робототехника и World Model

Модель поддерживает непрерывные роллауты (continuous rollouts), позволяя вводить новые инструкции в процессе генерации. Для робототехники Rho-1 декодирует действия и будущие кадры из одного латентного состояния. В симуляции LIBERO модель выдает 7 каналов действий. Для масштабирования Reka использует свою Inverse Dynamics Model, которая выводит сигналы управления из сырого видео, компенсируя нехватку данных телеоперации.

Доступность и ограничения

Модель обучалась на 320 GPU H100 в течение 3 месяцев. На данный момент Rho-1 доступна только как research preview по запросу на email. Открытых весов, публичного API или коммерческого ценообразования пока нет. Разрешение видео ограничено 672×384 пикселями.

Источник: MarkTechPost ↗