Инструменты26 июля 2026 г., 21:45 МСК🤖 Auto

LiveCC: Первый видео-LLM для комментариев в реальном времени

Команда ShowLab представила LiveCC — модель на базе Qwen2-VL-7B, способную генерировать устные комментарии к видео с задержкой менее секунды, побивая бенчмарки по стримингу и офлайн-анализу.

Баннер новости 4432

Прорыв в реальном времени

LiveCC (Live Commentary) — это первая видео-языковая модель, обученная с использованием метода потоковой транскрипции речи (streaming speech transcription). В отличие от традиционных моделей, которые анализируют видео целиком после завершения записи, LiveCC обрабатывает видеопоток и аудиодорожку параллельно, генерируя комментарии с минимальной задержкой. Это открывает возможности для трансляций спортивных событий, стримов и образовательного контента, где важна мгновенная реакция.

Архитектура и обучение

Модель базируется на архитектуре Qwen2-VL-7B. Ключевая инновация — использование визуальных токенов с ограничением по размеру: минимум 78 400 пикселей (100 токенов) и максимум 19 267 584 пикселя (24k токенов) на видео. Это позволяет обрабатывать ролики длительностью до 4 минут при 60 кадрах в секунду без перегрузки контекстного окна.

Обучение проходило в два этапа:

  • Pre-training: на датасете Live-CC-5M (5 миллионов видео-аудио пар).
  • SFT (Supervised Fine-Tuning): на смеси датасетов Live-WhisperX-526K, LLaVA-Video-178K, OneVision и LLaVA-Hound.

Для оптимизации использовались DeepSpeed ZeRO-2, Liger Kernel и смешанная точность BF16/TF32 на GPU NVIDIA Ampere+.

Результаты бенчмарков

LiveCC демонстрирует лидерские позиции как в задачах стриминга, так и в офлайн-анализе. Ниже приведены сравнительные метрики на датасете LiveSports3KCC (реальные спортивные трансляции):

Метрика LiveCC-7B-Instruct Qwen2.5-VL-7B LLaVA-Video-7B
Streaming Win Rate (vs GPT-4o) 54.2% 48.5% 42.1%
Offline Captioning BLEU-4 0.312 0.298 0.285
Latency (ср. задержка) < 1 сек N/A (офлайн) N/A (офлайн)

Оценка проводилась через LLM-judge (Azure GPT-4o), где LiveCC показал преимущество в качестве описания динамичных событий в реальном времени.

Практическое применение

Модель доступна для локального запуска через Gradio-демо или CLI. Для инференса требуется Python 3.11+, PyTorch 2.6.0 и библиотеки flash-attn, livecc-utils. Модель поддерживает интеграцию с JavaScript-мониторингом видео для синхронизации комментариев с таймкодами, что критично для приложений реального времени.

Почему это важно

LiveCC решает фундаментальную проблему «позднего анализа» в видео-LLM. Способность модели «понимать» видео на лету, не дожидаясь его окончания, делает её незаменимой для интерактивных систем. Открытый код и веса модели (LiveCC-7B-Base и LiveCC-7B-Instruct) уже доступны на Hugging Face, что позволяет разработчикам интегрировать функции живого комментирования в свои продукты.

Источник: Github ↗