Прорыв в реальном времени
LiveCC (Live Commentary) — это первая видео-языковая модель, обученная с использованием метода потоковой транскрипции речи (streaming speech transcription). В отличие от традиционных моделей, которые анализируют видео целиком после завершения записи, LiveCC обрабатывает видеопоток и аудиодорожку параллельно, генерируя комментарии с минимальной задержкой. Это открывает возможности для трансляций спортивных событий, стримов и образовательного контента, где важна мгновенная реакция.
Архитектура и обучение
Модель базируется на архитектуре Qwen2-VL-7B. Ключевая инновация — использование визуальных токенов с ограничением по размеру: минимум 78 400 пикселей (100 токенов) и максимум 19 267 584 пикселя (24k токенов) на видео. Это позволяет обрабатывать ролики длительностью до 4 минут при 60 кадрах в секунду без перегрузки контекстного окна.
Обучение проходило в два этапа:
- Pre-training: на датасете Live-CC-5M (5 миллионов видео-аудио пар).
- SFT (Supervised Fine-Tuning): на смеси датасетов Live-WhisperX-526K, LLaVA-Video-178K, OneVision и LLaVA-Hound.
Для оптимизации использовались DeepSpeed ZeRO-2, Liger Kernel и смешанная точность BF16/TF32 на GPU NVIDIA Ampere+.
Результаты бенчмарков
LiveCC демонстрирует лидерские позиции как в задачах стриминга, так и в офлайн-анализе. Ниже приведены сравнительные метрики на датасете LiveSports3KCC (реальные спортивные трансляции):
| Метрика | LiveCC-7B-Instruct | Qwen2.5-VL-7B | LLaVA-Video-7B |
|---|---|---|---|
| Streaming Win Rate (vs GPT-4o) | 54.2% | 48.5% | 42.1% |
| Offline Captioning BLEU-4 | 0.312 | 0.298 | 0.285 |
| Latency (ср. задержка) | < 1 сек | N/A (офлайн) | N/A (офлайн) |
Оценка проводилась через LLM-judge (Azure GPT-4o), где LiveCC показал преимущество в качестве описания динамичных событий в реальном времени.
Практическое применение
Модель доступна для локального запуска через Gradio-демо или CLI. Для инференса требуется Python 3.11+, PyTorch 2.6.0 и библиотеки flash-attn, livecc-utils. Модель поддерживает интеграцию с JavaScript-мониторингом видео для синхронизации комментариев с таймкодами, что критично для приложений реального времени.
Почему это важно
LiveCC решает фундаментальную проблему «позднего анализа» в видео-LLM. Способность модели «понимать» видео на лету, не дожидаясь его окончания, делает её незаменимой для интерактивных систем. Открытый код и веса модели (LiveCC-7B-Base и LiveCC-7B-Instruct) уже доступны на Hugging Face, что позволяет разработчикам интегрировать функции живого комментирования в свои продукты.
Источник: Github ↗
