Архитектура без посредников
Reka выпустила исследовательскую версию модели Rho-1, обученную с нуля. В отличие от типичных мультимодальных систем, где задачи передаются от одной специализированной модели к другой (что создает задержки), Rho-1 использует единый нейросетевой блок. Текст, изображения, видео и действия робота представлены как токены в одном окне контекста. Модель способна нарисовать маяк, выделить его рамкой, анимировать, изменить фон на снежную бурю и объяснить разницу за 5 шагов без вызова внешних инструментов.
Двухпоточный дизайн и KV Cache
Ключевая инновация — использование двух потоков экспертов в каждом блоке трансформера, разделяющих единый KV Cache:
- Поток понимания: обрабатывает язык и визуальный парсинг (дискретные токены).
- Поток генерации: декодирует латенты в изображения и видео (непрерывные токены).
При необходимости вывода пикселей поток понимания отправляет дискретный токен-переключатель, после чего поток генерации рендерит результат на основе накопленного состояния. Это позволяет выдавать координаты bounding box как токены, а не через отдельный детектор, и переиспользовать представления кадров видео без повторного кодирования.
Скорость и дистилляция
Базовая модель генерирует видео со скоростью 0.79x от реального времени (медиана), с первым клипом через ~6 секунд. Однако основная ценность — в дистиллированной версии, где количество шагов денормализации сокращено с 99 до 8. Это позволяет генерировать 5.3-секундный клип примерно за 1 секунду, что сопоставимо с fastest dedicated image models во внутренних тестах Reka.
Сравнение с конкурентами
Rho-1 выделяется нативной поддержкой действий роботов и непрерывного видео, чего нет у многих аналогов. Ниже приведено сравнение ключевых характеристик:
| Характеристика | Reka Rho-1 | ByteDance BAGEL | BAAI Emu3.5 | Google Genie 3 |
|---|---|---|---|---|
| Параметры | 19B | 14B (7B active MoT) | 34B | Не раскрыто |
| Входы | Текст, изображение, видео, действия, проприоцепция | Текст, изображение | Чередующийся текст и изображение | Текст, навигация |
| Выходы | Текст, изображение, видео, действия, проприоцепция | Текст, изображение | Чередующийся текст и изображение | Интерактивное видео |
| Нативное видео | Да (до 672×384) | Нет | Нет (кадры, не клипы) | Да (720p, 24 fps) |
| Управление роботами | Да (непрерывные токены действий) | Нет | Демонстрации манипуляции | Навигационные действия |
| Нет (Research Preview) | Да (Apache 2.0) | Да (Apache 2.0) | Нет |
Робототехника и World Model
Модель поддерживает непрерывные роллауты (continuous rollouts), позволяя вводить новые инструкции в процессе генерации. Для робототехники Rho-1 декодирует действия и будущие кадры из одного латентного состояния. В симуляции LIBERO модель выдает 7 каналов действий. Для масштабирования Reka использует свою Inverse Dynamics Model, которая выводит сигналы управления из сырого видео, компенсируя нехватку данных телеоперации.
Доступность и ограничения
Модель обучалась на 320 GPU H100 в течение 3 месяцев. На данный момент Rho-1 доступна только как research preview по запросу на email. Открытых весов, публичного API или коммерческого ценообразования пока нет. Разрешение видео ограничено 672×384 пикселями.
Источник: MarkTechPost ↗
