LAION Big Video Dataset (LAION-BVD)

Affiliaties:

  • Tübingen AI Center, University of Tübingen
  • LAION
  • JSC, FZJ
  • Wynd Labs
  • MPI for Intelligent Systems, ELLIS Institute Tübingen
  • MCML, Technical University Munich

Abstract

Wij presenteren LAION-BVD (LAION — Big Video Dataset), een grootschalige open videodataset voor multimodaal leren. De dataset bevat 1,3 miljard platformspecifieke video-URL's die zijn verzameld via CommonCrawl. Hiervan hebben we 80 miljoen video's gedownload met een totale duur van 10 miljoen uur. De dataset is ontworpen voor multimodale pre-training over video-, audio- en beeldmodaliteiten.

Met behulp van content-bewuste scènedetectie extraheren we clips waarvoor we synthetisch video- en audiobeschrijvingen (captions) genereren. Modellen die op deze data zijn getraind, behalen concurrerende prestaties op standaard video-tekst en audio-tekst benchmarks, met consistente verbeteringen naarmate de trainings- of modelomvang toeneemt.

Daarnaast onderzoeken we videoframes als alternatieve bron van beeld-tekstdata door frames te extraheren bij scènewisselingen. Deze frames vertonen een visuele distributie die verschilt van standaard web-beeldcorpora, en modellen die op deze dataset zijn getraind, behalen sterke prestaties bij beeld-tekst retrieval.

We stellen LAION-BVD beschikbaar aan de onderzoeksgemeenschap. Dit breidt de open toegang tot multimodale video's op een ongekende schaal aanzienlijk uit.

De cijfers

LAION-BVD kenmerkt zich door een ongekende schaal en is het grootste openbaar toegankelijke videocorpus voor onderzoek naar multimodaal leren.

  • 1,3 miljard Video-URL's: Platformspecifieke URL's verzameld vanuit Common Crawl.
  • 80 miljoen Gedownloade Video's: Succesvol gedownloade en verwerkte video's.
  • 10 miljoen uur Totale Duur: Gecombineerde video-inhoud over alle downloads.
  • 55 miljoen Geannoteerde Clips: Clips voorzien van synthetisch gegenereerde videobeschrijvingen.
  • 300 miljoen Geëxtraheerde Frames: Videoframes voor beeld-tekst pre-training.

Experimentele resultaten en benchmarks

Modellen die zijn getraind op LAION-BVD behalen concurrerende prestaties over video-, audio- en beeld-tekst benchmarks.

ViCLIP (Video-Taal Benchmarks)

ViCLIP-modellen getraind op LAION-BVD evenaren of overtreffen modellen getraind op InternVid met tot 2,1% op standaard video-tekst benchmarks. Er is sprake van consistente verbeteringen naarmate de trainingsschaal groeit van 10 miljoen naar 50 miljoen clips.

  • Tot +2,1% ten opzichte van de InternVid (FLT) baseline.
  • Consistente winst bij een schaal van 10M tot 50M clips.
  • Gebaseerd op 55M clips met synthetische videobeschrijvingen.

CLAP (Audio-Taal Benchmarks)

CLAP-modellen getraind op LAION-BVD behalen concurrerende prestaties ten opzichte van andere grootschalige, niet-gecureerde audiodatasets, door gebruik te maken van rijke, natuurlijke geluidslandschappen die direct uit video's zijn geëxtraheerd.

  • Concurrerend met niet-gecureerde audiodatasets.
  • Audio-tekst paren afkomstig uit diverse video's.
  • Goede schaalbaarheidstrends bij het vergroten van de model- en dataschaal.

CLIP (Beeld-Tekst Benchmarks)

Op frames gebaseerde CLIP-modellen behalen sterke prestaties bij beeld-tekst retrieval op standaard benchmarks. Videoframes vertonen een visuele distributie die verschilt van typische webcorpora, wat bestaande bronnen voor beeld-pre-training aanvult.

  • Sterke retrieval op standaard benchmarks.
  • 300 miljoen frames met een unieke visuele distributie.
  • Vult standaard web-beelddatasets aan.

Verantwoord gebruik

Ethiek & Release-verklaring

LAION-BVD is vrijgegeven om open en reproduceerbaar multimodaal onderzoek op grote schaal te ondersteunen. Grootschalige videodatasets en de modellen die erop zijn getraind, zijn in toenemende mate geconcentreerd bij een klein aantal voornamelijk commerciële technologiebedrijven, wat onafhankelijk wetenschappelijk onderzoek en reproduceerbaarheid beperkt. Door een open bron voor academisch onderzoek te bieden, streven we ernaar de toegang tot multimodale trainingsdata te verbreden en een transparantere evaluatie van grootschalige video-, audio- en beeldmodellen mogelijk te maken.

LAION-BVD is uitsluitend vrijgegeven voor onderzoeksdoeleinden en niet voor commercieel gebruik. De dataset is bedoeld ter ondersteuning van wetenschappelijk onderzoek, reproduceerbaarheid, veiligheidsanalyse en de studie van multimodale fundamentmodellen en gerelateerde systemen. We moedigen gebruikers aan om de rechten en het auteursrecht van contentmakers te respecteren en de dataset verantwoord te gebruiken, in overeenstemming met de geldende wetgeving en platformvoorwaarden.

Zoals andere grootschalige webdatasets kan LAION-BVD vooroordelen (biases), stereotypen en een ongelijke representatie bevatten over talen, regio's en onderwerpen. Modellen die op deze data zijn getraind, kunnen deze vooroordelen overnemen. Onderzoekers die de dataset gebruiken, dienen zich bewust te zijn van deze beperkingen en deze, waar relevant, te evalueren en te rapporteren naast de mogelijkheden van het model.

Referentie

Citatie (BibTeX)

@misc{laionbvd2026,
title={LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training},
author={Andreas Hochlehnert and Marianna Nezhurina and Mehdi Cherti and Andrej Radonjic and Thaddäus Wiedemer and Christoph Schuhmann and Romain Beaumont and Wieland Brendel and Bernhard Schölkopf and A. Sophia Koepke and Jenia Jitsev and Matthias Bethge},
year={2026},
eprint={2608.24845},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2608.24845},
}