开源数据
收录多模态领域经典与前沿数据集,提供高质量的基础模型训练与评测资源。
ShareGPT4Video
基于 GPT4-Vision 生成的 4.8M 大规模多模态视频描述数据集。旨在增强大视频语言模型(LVLMs)和文生视频模型(T2VMs)的模态对齐与细粒度视觉感知,助力开源模型追赶 GPT4V 和 Sora 的理解能力。
COYO-700M
COYO-700M 是由 Kakao Brain 开发的大规模图文对齐数据集,包含 7.47 亿对从 CommonCrawl 中提取的高质量图文对。它提供了丰富的元数据(如分辨率、相似度评分、NSFW 分数等),旨在为训练类似 CLIP、ALIGN 或文生图模型(如 Stable Diffusion)提供海量的基础素材。
ShareGPT4V
ShareGPT4V 是一个由 GPT4-Vision 驱动的大规模高质量多模态描述数据集,包含 120 万条图文数据。该数据集旨在增强大语言多模态模型(LMMs)在预训练和指令微调阶段的模态对齐及细粒度视觉感知能力,推动开源模型性能向 GPT4-Vision 靠拢。
AS-100M
AS-100M 是 All-Seeing 项目(AS-1B)的大规模精选子集,专注于全开放世界的泛视视觉识别与理解。该数据集包含超过 1 亿个区域级标注,涵盖语义标签、问答对(QA)及详细描述(Caption),支持图像/区域级别的识别、检索及复杂视觉推理任务。
InternVid
InternVid 是由 OpenGVLab 开发的大规模视频-文本数据集,旨在促进多模态理解与生成。该数据集包含超过 700 万条(核心子集 InternVid-10M-FLT 包含 1000 万条)高质量视频片段及其对应的精细描述(Captions)。
MS-COCO
微软推出的经典多模态基准数据集。包含超过 33 万张图像,提供了物体检测(Bounding Box)、实例分割(Segmentation)、人体关键点以及 5 句高质量的描述(Caption)标注。它是目前评估图像描述、多模态对齐及视觉感知算法最权威的标准之一。
SBU Captions
SBU Captioned Photo Dataset 是多模态学习领域的经典大规模数据集之一,包含超过 100 万张带有用户生成描述(Captions)的图像。该数据集通过在 Flickr 上搜索包含特定词汇的图片并进行过滤,筛选出图文相关性较高的配对。
Conceptual Captions
这是一个通过对互联网图片及其 Alt-text 进行自动化清洗和“超验化”处理后得到的大规模图文平行数据集。它将原始文本中的专有名词替换为通用概念,为训练高性能的自动图像字幕系统提供了高质量且分布广泛的数据资源。