В мире искусственного интеллекта, где доминируют специализированные решения, компания Reka совершает качественный скачок, выпуская исследовательскую версию модели Rho-1. Это не просто очередное обновление архитектуры, а фундаментальный сдвиг в парадигме обработки мультимодальных данных. Rho-1 — это 19-миллиардная модель, обученная с нуля, которая способна не только понимать, но и генерировать текст, изображения и видео, а также выдавать команды для управления роботами. Ключевая инновация заключается в том, что все эти задачи решаются единой нейронной сетью, работающей в одном контекстном окне, что позволяет отказаться от традиционных конвейерных систем, где данные передаются от одной узкоспециализированной модели к другой.
Традиционный подход к мультимодальному ИИ часто напоминает сложную фабричную линию. Центральный языковая модель планирует задачу, а затем передает её «специалистам»: одной модели для обработки изображений, другой для видео, третьей для детекции объектов. Каждый такой переход (handoff) добавляет задержку, а каждый специалист видит лишь узкую часть общей картины. Rho-1 разрушает эту архитектуру. Текст, визуальные данные и робототехнические действия становятся токенами внутри единого контекстного окна. По данным исследований Reka, модель может нарисовать маяк, выделить его рамкой, анимировать, изменить фон на снежную бурю и объяснить разницу — всё это за пять шагов, без вызова внешних инструментов и участия других моделей.
01Архитектура: Два потока, один кэш
Сердцем Rho-1 является инновационная архитектура, использующая два собственных формата данных для каждого входа и выхода. Первый формат — дискретные токены — отвечает за передачу текста, символических рассуждений и высокоуровневых команд. Второй формат — непрерывные токены — несет в себе латентные представления изображений, кадры видео, действия роботов и проприоцептивные данные (информацию о положении тела в пространстве). Такая двойственность позволяет модели гибко работать как с символической логикой, так и с непрерывными физическими сигналами.
Каждый блок трансформатора в Rho-1 содержит два потока весов экспертов. Поток понимания (understanding stream) занимается обработкой языка и визуальным парсингом, извлекая смысл из входящих данных. Поток генерации (generation stream) отвечает за деконволюцию латентов, превращая их обратно в изображения и видео. Важно отметить, что оба потока разделяют механизм внимания (attention) и оперируют над одним и тем же кэшем ключей и значений (KV cache). Это обеспечивает глубокую интеграцию информации: модель не просто хранит данные, она постоянно соотносит их друг с другом в едином пространстве состояний.
Когда ответ требует визуального отображения, поток понимания генерирует специальный дискретный токен-переключатель. После этого поток генерации берет на себя задачу рендеринга, используя все накопленные состояния. Обучение модели сочетает в себе предсказание следующего токена для дискретных последовательностей и flow matching (сопоставление потоков) для непрерывных выходов. На практике это означает, что ограничивающие рамки (bounding boxes) выводятся как токены координат, а не через отдельный детектор объектов, а первый кадр видео переиспользует уже существующее в контексте изображение, избегая повторного кодирования.

02Скорость: Базовая модель против дистиллированной версии
Одной из главных проблем мультимодальных генеративных моделей является скорость. Rho-1 предлагает два варианта работы, демонстрируя впечатляющие результаты. Базовая модель генерирует видео со скоростью 0.79x от реального времени (медианное значение). Это означает, что для создания 10-секундного клипа потребуется около 12-13 секунд вычислений. Однако зрительная полоса прокрутки (stream) начинается примерно через 6 секунд, что делает процесс интерактивным и плавным.
Для сравнения, команда Reka измерила время получения первого клипа в 7.0 секунд, тогда как типичный многоагентный пайплайн, использующий отдельные модели для каждого этапа, занимал бы около 13.8 секунд. Это почти двукратное ускорение за счет устранения накладных расходов на передачу данных между моделями.
Особого внимания заслуживает дистиллированная версия модели. В ней количество шагов денормализации (denoising) сокращено с 99 до 8, что при минимальной потере качества позволяет возвращать 5.3-секундный клип примерно за одну секунду. Во внутренних тестах Reka эта версия показала результаты, сопоставимые с самыми быстрыми специализированными моделями генерации изображений, и стала самой быстрой среди протестированных моделей по времени получения первого текстового токена. Важно отметить, что эти тесты проводились самой компанией-разработчиком, поэтому независимые бенчмарки могут показать иные результаты.
03Мировая модель и робототехника
Rho-1 не ограничивается статичной генерацией контента. Она функционирует как непрерывная мировая модель (world model), генерируя видео клип за клипом. Новые инструкции поступают через поток понимания и обновляют состояние модели прямо во время генерации (mid-rollout). В демонстрациях Reka показано, как траектория движения может разветвляться: модель предлагает варианты «повернуть налево» и «повернуть направо», продолжая генерацию сценария для каждого из них.

В сфере робототехники Rho-1 демонстрирует способность декодировать действия и будущие кадры из одного и того же латентного состояния. В симуляции LIBERO модель выдает 7 каналов действий, что позволяет роботу выполнять сложные манипуляции. Однако данные для обучения робототехническим действиям часто scarce (дефицитны). Чтобы решить эту проблему, Reka комбинирует Rho-1 со своей Моделью обратной динамики (Inverse Dynamics Model). Эта вспомогательная система выводит сигналы управления из сырых видеоданных, позволяя масштабировать обучение без необходимости сбора огромных массивов логов телеоперации.
04Сравнение с конкурентами
Чтобы оценить место Rho-1 на рынке, рассмотрим её характеристики в сравнении с другими ведущими мультимодальными моделями, такими как ByteDance BAGEL, BAAI Emu3.5 и Google Genie 3. Данные актуальны на октябрь 2026 года.
Параметры и архитектура: Rho-1 имеет 19 миллиардов параметров. Для сравнения, BAGEL от ByteDance использует 14 миллиардов (из которых 7 активны в режиме MoT), а Emu3.5 от BAAI — 34 миллиарда. Google не раскрывает точное число параметров для Genie 3. Rho-1 выделяется тем, что поддерживает нативную генерацию видео, в то время как Emu3.5 генерирует отдельные кадры, а BAGEL не поддерживает видео вообще.
Входы и выходы: Rho-1 принимает текст, изображения, видео, действия и проприоцепцию, выдавая всё это в том же формате. Google Genie 3 фокусируется на интерактивных видеомирах с навигационными входами, но не выдает действий для роботов. BAAI Emu3.5 работает с чередующимся текстом и изображениями, но не с видео-клипами в нативном формате.

Открытость: BAGEL и Emu3.5 имеют открытые веса под лицензией Apache 2.0, что позволяет локальный запуск. Rho-1 на данный момент доступна только как исследовательская превью-версия через контакт с Reka, без публичных весов или API. Google Genie 3 доступен подписчикам Google AI Ultra через проект Genie.
05Практическое применение и ограничения
Несмотря на впечатляющие технические характеристики, Rho-1 имеет ряд ограничений, о которых следует знать потенциальным пользователям. Во-первых, разрешение видео ограничено 672x384 пикселями. Хотя для многих задач прототипирования и интерактивного взаимодействия этого достаточно, для профессионального видеопроизводства может потребоваться апскейлинг. Во-вторых, модель обучалась на 320 GPU H100 в течение трех месяцев. Это указывает на значительные вычислительные затраты, что делает локальный запуск базовой версии на потребительском оборудовании практически невозможным без серьезной оптимизации или использования дистиллированной версии.
Доступ к Rho-1 сегодня ограничен исследовательским превью. Компания не предоставляет публичного API или тарифных планов. Это стратегический шаг, позволяющий Reka собрать обратную связь от научного сообщества и разработчиков перед коммерческим запуском. Для тех, кто хочет попробовать модель, необходимо связаться с Reka по адресу contact@reka.ai. Это открывает возможности для ранних последователей (early adopters) в сфере робототехники и мультимодального ИИ, которые могут интегрировать Rho-1 в свои пилотные проекты.
06Что это значит на практике
Появление Rho-1 знаменует конец эры фрагментированных ИИ-пайплайнов. Для разработчиков это означает возможность создания более простых, быстрых и надежных приложений. Вместо того чтобы настраивать взаимодействие между несколькими моделями (LLM для логики, Stable Diffusion для картинок, LLM-Video для клипов), можно использовать один вызов к Rho-1. Это снижает сложность отладки, уменьшает задержки и повышает консистентность результатов.
В робототехнике Rho-1 позволяет создавать агентов, которые «видят» и «действуют» в реальном времени, понимая причинно-следственные связи в динамической среде. Это критически важно для автономных систем, от дронов до промышленных манипуляторов. Хотя модель пока не доступна для широкого использования, её архитектура задает новый стандарт для будущих мультимодальных систем. Следующим шагом станет коммерциализация этой технологии и, возможно, открытие весов для сообщества, что может привести к взрывному росту инноваций в области ИИ-агентов.
Reka Rho-1 — это не просто еще одна модель. Это шаг к созданию универсальных интеллектуальных систем, способных воспринимать мир так же целостно, как это делают люди, объединяя язык, зрение и действие в единый поток сознания. Для России и СНГ это также открывает новые горизонты для локализации и адаптации подобных технологий, особенно в сфере промышленной автоматизации и образовательных ИИ-платформ, где важна скорость и точность реакции системы.
Источник: MarkTechPost ↗
