开源数据

收录多模态领域经典与前沿数据集,提供高质量的基础模型训练与评测资源。

模态
语言
规模
共找到 84 个数据集
ImageTextVideo

ShareGPT4Video

基于 GPT4-Vision 生成的 4.8M 大规模多模态视频描述数据集。旨在增强大视频语言模型(LVLMs)和文生视频模型(T2VMs)的模态对齐与细粒度视觉感知,助力开源模型追赶 GPT4V 和 Sora 的理解能力。

Lang
English
Year
2024
Samples
4.8M
ImageText

COYO-700M

COYO-700M 是由 Kakao Brain 开发的大规模图文对齐数据集,包含 7.47 亿对从 CommonCrawl 中提取的高质量图文对。它提供了丰富的元数据(如分辨率、相似度评分、NSFW 分数等),旨在为训练类似 CLIP、ALIGN 或文生图模型(如 Stable Diffusion)提供海量的基础素材。

Lang
English
Year
2022
Samples
747M
ImageText

ShareGPT4V

ShareGPT4V 是一个由 GPT4-Vision 驱动的大规模高质量多模态描述数据集,包含 120 万条图文数据。该数据集旨在增强大语言多模态模型(LMMs)在预训练和指令微调阶段的模态对齐及细粒度视觉感知能力,推动开源模型性能向 GPT4-Vision 靠拢。

Lang
English
Year
2023
Samples
1.2M
ImageText

AS-100M

AS-100M 是 All-Seeing 项目(AS-1B)的大规模精选子集,专注于全开放世界的泛视视觉识别与理解。该数据集包含超过 1 亿个区域级标注,涵盖语义标签、问答对(QA)及详细描述(Caption),支持图像/区域级别的识别、检索及复杂视觉推理任务。

Lang
English
Year
2024
Samples
100M
VideoText

InternVid

InternVid 是由 OpenGVLab 开发的大规模视频-文本数据集,旨在促进多模态理解与生成。该数据集包含超过 700 万条(核心子集 InternVid-10M-FLT 包含 1000 万条)高质量视频片段及其对应的精细描述(Captions)。

Lang
English
Year
2023
Samples
10M
ImageText

MS-COCO

微软推出的经典多模态基准数据集。包含超过 33 万张图像,提供了物体检测(Bounding Box)、实例分割(Segmentation)、人体关键点以及 5 句高质量的描述(Caption)标注。它是目前评估图像描述、多模态对齐及视觉感知算法最权威的标准之一。

Lang
English
Year
2017
Samples
330K
ImageText

SBU Captions

SBU Captioned Photo Dataset 是多模态学习领域的经典大规模数据集之一,包含超过 100 万张带有用户生成描述(Captions)的图像。该数据集通过在 Flickr 上搜索包含特定词汇的图片并进行过滤,筛选出图文相关性较高的配对。

Lang
English
Year
2011
Samples
1M
ImageText

Conceptual Captions

这是一个通过对互联网图片及其 Alt-text 进行自动化清洗和“超验化”处理后得到的大规模图文平行数据集。它将原始文本中的专有名词替换为通用概念,为训练高性能的自动图像字幕系统提供了高质量且分布广泛的数据资源。

Lang
English
Year
2018
Samples
3.3M
ImageText

LAION-400M

LAION-400M 是一个大规模的图文数据集,包含从Common Crawl中提取并经过CLIP模型过滤的4亿个图像-文本对。该数据集提供了图像 URL、原始文本描述(Alt-text)、CLIP 嵌入向量以及 kNN 索引,旨在为全球研究社区提供训练类似 CLIP 和 DALL-E 等大规模多模态模型的基础资源。

Lang
English
Year
2021
Samples
400M
...