Архитектура «Чат → Видео»
Infinite Livestream — это end-to-end решение, которое автоматизирует создание видеоконтента на основе пользовательских запросов. Система работает в два этапа:
- Клиентская часть (streaming-client): Подключается к чату (Twitch/YouTube), перехватывает команды вида
!prompt <idea>, преобразует их в структурированные сцены и отправляет в очередь модели через Reactor SDK. - Модель (fast-h3): Принимает запросы, генерирует видеоклипы и синхронизированный аудио, затем выводит их через RTMP как единый непрерывный поток.
Технические характеристики модели FastH3
В основе системы лежит модель MiniMax-H3 (35B параметров), разработанная компанией MiniMaxAI. Проект FastVideo провел дистилляцию этой модели, оптимизировав её для скорости:
- Сокращено количество трансформерных проходов до 4-х.
- Использована 90% sparse video attention (разреженное внимание) для ускорения генерации.
- Модель генерирует видео и аудио совместно из текстового промпта.
- Разрешение выходного видео: 768p.
Сравнение компонентов системы
| Компонент | Функция | Требования к железу/ПО |
|---|---|---|
| fast-h3/ | Генерация видео/аудио, управление очередью | Reactor Runtime, 8x B200 GPU |
| streaming-client/ | Обработка чата, RTMP-вывод | Python (reactor-sdk), ffmpeg |
| fasth3_types.py | Контракт взаимодействия (команды, треки) | WebRTC, Python SDK |
Лицензирование и запуск
Код проекта распространяется под лицензией Apache 2.0, что позволяет свободно использовать и модифицировать его. Однако веса модели MiniMax H3 имеют отдельную лицензию — MiniMax H3 Community License.
Для локального тестирования достаточно установить зависимости через pip и иметь установленный ffmpeg. Система поддерживает как локальный запуск (python main.py --local), так и полноценную стриминговую конфигурацию с подключением к реальным чатам.
Источник: Github ↗
