HeadlinesBriefing favicon HeadlinesBriefing.com

LAION-BVD:13亿视频URL开放数据集

Hacker News •
×

LAION 研究人员发布了 LAION-BVD(大型视频数据集),这是目前最大的公开可访问视频语料库,用于多模态学习研究。该数据集包含 1.3B 个平台特定视频 URL,这些 URL 从 Common Crawl 收集而来,其中 80M 个视频成功下载,总计 1000万小时 的内容。通过内容感知场景检测,研究人员提取了片段并合成生成了视频和音频字幕用于标注。

在 LAION-BVD 上训练的模型在视频、音频和图像-文本基准测试中表现出竞争性能。基于 LAION-BVD 训练的视频 CLIP 模型在标准视频-文本基准测试上匹配或超过 InternVid 训练的模型,最高提升达 2.1%,随着训练规模从 10M 增加到 50M 片段,性能持续提升。在该数据集上训练的 CLAP 模型利用多样化的野外声音景观实现了竞争性的音频-语言表现。此外,300M 个提取的视频帧表现出独特的视觉分布,区别于标准网络图像语料库,在图像-文本检索任务中取得了强效果。

该数据集仅供研究目的发布,作者包括来自 Tübingen AI Center、LAION、JSC FZJ、Wynd Labs、MPI for Intelligent Systems 和 Technical University Munich 等机构的 Marianna Nezhurina、Mehdi Cherti、 Andrej Radonjic、Christoph Schuhmann、Romain Beaumont、Wieland Brendel、Bernhard Schölkopf、A. Sophia Koepke、Jenia Jitsev 和 Matthias Bethge。LAION-BVD 旨在扩大多模态训练数据的访问范围,并实现基础模型的透明评估。

关键实体:公司:LAION、Tübingen AI Center、JSC FZJ、Wynd Labs、MPI for Intelligent Systems、ELLIS Institute Tübingen、MCML、Technical University Munich、Common Crawl | 人员:Marianna Nezhurina、Mehdi Cherti、Andrej Radonjic、Thaddäus Wiedemer、Christoph Schuhmann、Romain Beaumont、Wieland Brendel、Bernhard Schölkopf、A. Sophia Koepke、Jenia Jitsev、Matthias Bethge | 地点:Tübingen、Munich