Масштаб и структура датасета
Исследователи из Университета Тюбингена, LAION и других институтов представили LAION-BVD (Big Video Dataset) — крупнейший на данный момент открытый корпус данных для мультимодального обучения. Датасет сформирован путем парсинга Common Crawl, где было собрано 1,3 млрд URL-адресов видео. Из них успешно загружено и обработано 80 миллионов видео, суммарная длительность которых составляет 10 миллионов часов.
Для подготовки данных к обучению моделей применена сцена-ориентированная детекция (content-aware scene detection). На основе этого алгоритма выделены клипы, для которых синтетически сгенерированы текстовые описания (captions). Итоговый набор включает 55 миллионов клипов с подписями, а также 300 миллионов кадров, извлеченных в моменты смены сцен для задач image-text pre-training.
Результаты бенчмарков: сравнение с лидерами
Ключевое преимущество LAION-BVD демонстрируется в сравнении с закрытыми или менее масштабными наборами данных. Модели ViCLIP, обученные на этом датасете, показывают конкурентоспособные результаты на стандартных тестах видео-текст, аудио-текст и изображение-текст. Особенно заметен прогресс при увеличении масштаба обучения.
| Модель / Задача | Данные обучения | Результат / Преимущество |
|---|---|---|
| ViCLIP (Video-Language) | 10M – 50M клипов | Превосходство до +2.1% над базовой моделью InternVid (FLT). Стабильный рост метрик с увеличением объема данных. |
| CLAP (Audio-Language) | Звуковые дорожки из видео | Конкурентные результаты с другими крупными нефильтрованными аудио-датасетами. Хорошая масштабируемость. |
| CLIP (Image-Text) | 300M кадров (смена сцен) | Сильная производительность в retrieval-задачах. Визуальное распределение кадров отличается от стандартных веб-корпусов, дополняя их. |
Почему это важно для индустрии
Доступ к таким объемам видеоданных долгое время был ограничен крупными проприетарными компаниями, что создавало барьер для независимых исследований. LAION-BVD позволяет академическому сообществу проводить воспроизводимые эксперименты с мультимодальными фундаментальными моделями. Исследователи отмечают, что кадры, извлеченные из видео, имеют иную визуальную дистрибуцию по сравнению с обычными веб-изображениями, что может помочь моделям лучше понимать динамику сцен и контекст.
Условия использования и этика
Датасет выпущен исключительно для исследовательских целей (research purposes). Коммерческое использование запрещено. Авторы подчеркивают необходимость ответственного подхода: датасет, как и другие крупные веб-наборы, может содержать предвзятость (bias), стереотипы и неравномерное представительство языков и регионов. Исследователям рекомендуется оценивать и документировать эти ограничения при использовании данных.
Технические детали
Работа опубликована в arXiv (eprint: 2608.24845) в августе 2026 года. Авторы: Andreas Hochlehnert, Marianna Nezhurina, Mehdi Cherti, Christoph Schuhmann и др. Полный доступ к коду и данным предоставлен через GitHub и проект LAION.
Источник: Laion ↗
