Релиз модели3 сентября 2026 г., 19:46 МСК🤖 Auto

SolarWM: ИИ-мир, который помнит часы, а не секунды

Новая модель SolarWM от Junchao CS позволяет генерировать согласованные видео-миры длительностью в часы, обучаясь всего на 5-секундных клипах.

Баннер новости 6700

Прорыв в долгосрочной консистентности

Команда разработчиков под руководством Junchao CS представила SolarWM (Solar World Model) — архитектуру, решающую критическую проблему генеративных моделей: потерю контекста при длительных сессиях. В отличие от существующих решений, которые «забывают» начало сцены через несколько секунд, SolarWM обеспечивает реактивное взаимодействие в реальном времени и когерентную эволюцию мира на протяжении минут и даже часов.

Уникальная архитектура обучения

Ключевая инновация заключается в парадигме обучения. Модель тренируется исключительно на коротких видеофрагментах длительностью 5 секунд. Несмотря на это ограничение, при инференсе (выводе) система способна масштабировать генерацию до часовых интервалов, сохраняя физическую логику и визуальную целостность сцены. Это позволяет пользователю взаимодействовать с миром без разрывов в нарративе или визуальных артефактов.

Технические характеристики и возможности

Система позиционируется как инструмент для создания иммерсивных сред, где пользователь может не просто смотреть, а взаимодействовать. Ниже приведено сравнение ключевых параметров подхода SolarWM с типичными ограничениями базовых видео-генераторов:

Параметр SolarWM Типичные аналоги
Длительность инференса Минуты / Часы 2–10 секунд
Данные для обучения 5-секундные клипы Длинные видео (редко)
Реактивность Real-time (взаимодействие) Оффлайн-генерация
Консистентность мира Высокая (hour-scale) Низкая (дрейф концепций)

Почему это важно?

Способность модели «помнить» состояние мира на протяжении длительного времени открывает путь к созданию полноценных интерактивных симуляций и игр, где ИИ выступает не просто как генератор контента, а как живой мир. Это снижает вычислительные затраты на обработку длинных последовательностей, так как модель не требует переобучения на огромных датасетах часовых видео, а использует эффективный механизм масштабирования из коротких паттернов.

Где найти код?

Проект открыт в рамках исследовательской работы Junchao CS. Исходный код и документация доступны на GitHub-странице проекта, что позволяет разработчикам протестировать архитектуру в своих задачах по созданию виртуальных сред.

Источник: Github ↗