Релиз модели7 августа 2026 г., 17:45 МСК🤖 Auto

Sand AI представила Magi-2: 114B параметров и 6B активных для видео

Лаборатория Sand AI выпустила превью модели Magi-2, способной генерировать синхронизированное аудио-видео. Архитектура использует 114B параметров, но вычисляет только 6B на токен, решая проблему масштабируемости.

Баннер новости 5315

Проблема масштабирования видео-генерации

В отличие от языковых моделей, где рост вычислительных ресурсов предсказуемо улучшает качество, в видео-генерации эта связь остается неочевидной. Sand AI отмечает, что предыдущие работы не дали достаточных доказательств того, что увеличение масштаба модели действительно улучшает сложную динамику, физическую правдоподобность или синхронизацию аудио и видео. Magi-2 создана, чтобы заполнить этот пробел, объединив три направления: архитектуру, систему обучения и методологию данных.

Архитектура MagiMoE: 114B против 6B

Ключевое нововведение — использование ультра-мелкозернистой архитектуры Mixture-of-Experts (MoE), названной MagiMoE. Модель имеет общий объем параметров около 114 миллиардов, но для обработки каждого токена активируется лишь малая часть. Это позволяет разделить общую емкость модели и вычислительные затраты на один токен, что критически важно для снижения стоимости инференса и ускорения генерации.

0
Характеристика Значение / Описание
Общее число параметров ~114 миллиардов (114B)
Активные параметры на токен ~6 миллиардов (6B)
Тип архитектурыSingle-Stream Transformer + MagiMoE
Обработка модальностей Единая последовательность токенов (текст, видео, аудио)

Single-Stream подход к мультимодальности

В отличие от Magi-1, которая использовала авторегрессионное разбиение видео на чанки, Magi-2 возвращается к более простой, но эффективной архитектуре Single-Stream. Все модальности — текст, видео и аудио — обрабатываются одним трансформером через механизм self-attention. Это позволяет моделям обмениваться информацией в едином бэкбоне, а не только через заранее определенные интерфейсы кросс-аттеншн, что лучше отражает естественную взаимосвязь движений губ, речи и звуков окружающей среды.

Системные вызовы и коммуникация

Прямое перенесение стандартных MoE-решений из LLM в видео-генерацию сталкивается с проблемами коммуникации. В стандартных системах размер передаваемых данных пропорционален длине последовательности и количеству экспертов, что создает дисбаланс нагрузки (stragglers) и неравномерное использование памяти. Sand AI разрабатывает кастомные ядра и системы маршрутизации для MagiMoE, чтобы минимизировать накладные расходы на all-to-all коммуникацию между устройствами при обучении и инференсе.

Значение для индустрии

Magi-2 Preview — это промежуточный исследовательский релиз, подтверждающий жизнеспособность совместного масштабирования архитектуры, инфраструктуры и данных на уровне 100B параметров. Успех этого подхода может стать фундаментом для создания «физического AGI», способного понимать и генерировать сложные временные ряды и пространственные взаимодействия, а не просто статичные изображения.

Источник: Sand ↗