Brief IA : LAION lance BVD, 10 M d’heures vidéo libres pour la recherche

LAION lance BVD, 10 M d’heures vidéo libres pour la recherche

Brief IA
Tom Levy·2 min·1 vues

LAION publie gratuitement le Big Video Dataset pour la recherche Le corpus comprend 80 millions de vidéos (10 millions d’heures), 55 millions de clips annotés et 300 millions d’images La plupart des vidéos proviennent de YouTube et sont en anglais.

En bref
1LAION publie gratuitement le Big Video Dataset pour la recherche
2Le corpus comprend 80 millions de vidéos (10 millions d’heures), 55 millions de clips annotés et 300 millions d’images
3La plupart des vidéos proviennent de YouTube et sont en anglais
4Une étude rapporte des gains jusqu’à 2,1 points sur des benchmarks vidéo‑texte
💡Pourquoi c'est importantCe jeu de données massif vise à accélérer la recherche en IA multimodale tout en s’appuyant sur un cadre légal spécifique.
Le brief IA que lisent les pros

La recherche en IA te passionne ?

Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

LAION met en ligne le Big Video Dataset, présenté comme un des plus grands ensembles vidéo ouverts dédiés à l’IA. Le téléchargement couvre 80 millions de vidéos pour 10 millions d’heures, avec 55 millions de clips annotés automatiquement et 300 millions d’images. L’accès est gratuit et réservé à la recherche, avec une référence possible à un jugement de 2024 à Hambourg.

Accès gratuit, usage recherche et appui sur un jugement de 2024

Le jeu de données et le code sont proposés en libre accès, mais pour des travaux de recherche uniquement. Un jugement du Tribunal régional de Hambourg en 2024 a autorisé LAION à collecter des contenus protégés pour un usage non commercial, et l’organisation pourrait probablement s’y référer pour ce cadre. LAION demande par ailleurs aux utilisateurs de respecter les droits des créateurs originaux.

Un corpus massif issu de CommonCrawl et majoritairement anglophone

Le BVD, présenté comme l’un des plus vastes ensembles ouverts pour l’IA, s’appuie sur 1,3 milliard d’URLs vidéo trouvées dans CommonCrawl. LAION en a téléchargé 80 millions, soit 10 millions d’heures, puis en a extrait 55 millions de clips avec descriptions générées automatiquement et 300 millions d’images fixes. La plupart des vidéos proviennent de YouTube et la majorité est en anglais.

Benchmarks revendiqués et modalité d’entraînement multimodale

Selon une étude, des modèles entraînés sur ce corpus dépassent de jusqu’à 2,1 points de pourcentage des modèles comparables entraînés sur InternVid sur des évaluations vidéo‑texte courantes. L’entraînement associe flux vidéo, audio et texte afin d’apprendre les correspondances entre scènes, descriptions et sons.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires