Релиз модели31 августа 2026 г., 09:45 МСК🤖 Auto

LAION выпустила BVD: 80 млн видео и 300 млн кадров для мультимодального обучения

Лаборатория LAION представила крупнейший открытый датасет LAION-BVD объемом 10 млн часов видео. Модель ViCLIP на этих данных превосходит аналоги на 2,1%.

Баннер новости 6398

Масштаб и структура датасета

Исследователи из Университета Тюбингена, LAION и других институтов представили LAION-BVD (Big Video Dataset) — крупнейший на данный момент открытый корпус данных для мультимодального обучения. Датасет сформирован путем парсинга Common Crawl, где было собрано 1,3 млрд URL-адресов видео. Из них успешно загружено и обработано 80 миллионов видео, суммарная длительность которых составляет 10 миллионов часов.

Для подготовки данных к обучению моделей применена сцена-ориентированная детекция (content-aware scene detection). На основе этого алгоритма выделены клипы, для которых синтетически сгенерированы текстовые описания (captions). Итоговый набор включает 55 миллионов клипов с подписями, а также 300 миллионов кадров, извлеченных в моменты смены сцен для задач image-text pre-training.

Результаты бенчмарков: сравнение с лидерами

Ключевое преимущество LAION-BVD демонстрируется в сравнении с закрытыми или менее масштабными наборами данных. Модели ViCLIP, обученные на этом датасете, показывают конкурентоспособные результаты на стандартных тестах видео-текст, аудио-текст и изображение-текст. Особенно заметен прогресс при увеличении масштаба обучения.

Модель / Задача Данные обучения Результат / Преимущество
ViCLIP (Video-Language) 10M – 50M клипов Превосходство до +2.1% над базовой моделью InternVid (FLT). Стабильный рост метрик с увеличением объема данных.
CLAP (Audio-Language) Звуковые дорожки из видео Конкурентные результаты с другими крупными нефильтрованными аудио-датасетами. Хорошая масштабируемость.
CLIP (Image-Text) 300M кадров (смена сцен) Сильная производительность в retrieval-задачах. Визуальное распределение кадров отличается от стандартных веб-корпусов, дополняя их.

Почему это важно для индустрии

Доступ к таким объемам видеоданных долгое время был ограничен крупными проприетарными компаниями, что создавало барьер для независимых исследований. LAION-BVD позволяет академическому сообществу проводить воспроизводимые эксперименты с мультимодальными фундаментальными моделями. Исследователи отмечают, что кадры, извлеченные из видео, имеют иную визуальную дистрибуцию по сравнению с обычными веб-изображениями, что может помочь моделям лучше понимать динамику сцен и контекст.

Условия использования и этика

Датасет выпущен исключительно для исследовательских целей (research purposes). Коммерческое использование запрещено. Авторы подчеркивают необходимость ответственного подхода: датасет, как и другие крупные веб-наборы, может содержать предвзятость (bias), стереотипы и неравномерное представительство языков и регионов. Исследователям рекомендуется оценивать и документировать эти ограничения при использовании данных.

Технические детали

Работа опубликована в arXiv (eprint: 2608.24845) в августе 2026 года. Авторы: Andreas Hochlehnert, Marianna Nezhurina, Mehdi Cherti, Christoph Schuhmann и др. Полный доступ к коду и данным предоставлен через GitHub и проект LAION.

Источник: Laion ↗