遇见数据集

WebMix-38M

收藏
Hugging Face2026-07-11 更新2026-07-12 收录
官方服务:

资源简介:

WebMix Parquet 是一个从多个公开图像-文本数据源整合而成的数据集,源数据集包括 cc12m、datacomp12m、yfcc15m 和 mscoco。数据以 Parquet 格式存储,图像以 Hugging Face `Image` 列格式(编码字节)保存。数据集包含多个结构化字段:核心字段为 `image`(图像)和 `caption`(文本描述);元数据字段包括 `source`(数据来源标识)、`split`(训练/验证分割)、`image_id`(图像唯一标识)、`source_dataset`(原始数据集名称)、`source_url`(原始图像URL)、`filename`(文件名)、`width`/`height`(图像尺寸)、`image_sha256`(图像哈希值)以及 `source_index`、`source_split`、`caption_index` 等索引字段。数据生成时,训练数据(`split` 为 train)来自 `cc12m`、`datacomp12m`、`yfcc15m` 三个源,而验证/支持数据(`split` 为 val)则来自 `mscoco` 源。该数据集适用于需要大规模图像-文本对的任务,如图像描述生成、视觉-语言预训练(VLP)、跨模态检索等。数据生成过程经过了详细配置,包括图像格式(JPEG)、质量、并行下载与处理参数,确保了数据的一致性和可处理性。

WebMix Parquet is a dataset integrated from multiple public image-text data sources, including cc12m, datacomp12m, yfcc15m, and mscoco. The data is stored in Parquet format, with images saved in the Hugging Face `Image` column format (encoded bytes). The dataset contains multiple structured fields: core fields are `image` (image) and `caption` (text description); metadata fields include `source` (data source identifier), `split` (train/validation split), `image_id` (unique image identifier), `source_dataset` (original dataset name), `source_url` (original image URL), `filename` (file name), `width`/`height` (image dimensions), `image_sha256` (image hash value), as well as index fields such as `source_index`, `source_split`, and `caption_index`. During data generation, training data (`split` as train) comes from the three sources `cc12m`, `datacomp12m`, and `yfcc15m`, while validation/support data (`split` as val) comes from the `mscoco` source. This dataset is suitable for tasks requiring large-scale image-text pairs, such as image caption generation, visual-language pre-training (VLP), and cross-modal retrieval. The data generation process is detailedly configured, including image format (JPEG), quality, parallel download, and processing parameters, ensuring data consistency and processability.

创建时间:
2026-07-11
原始信息汇总

数据集概述:WebMix-38M

WebMix-38M 是一个图像-文本配对数据集,以 Parquet 格式存储,专为多模态模型训练设计。数据集主要包含来自多个公开来源的图像及其对应的文本描述(标题)。

数据规模与来源

  • 总样本量:约3800万条(38M),来自以下四个公开数据集:
    • CC12M
    • DataComp 12M
    • YFCC15M
    • MS COCO(仅作为验证/支持集使用)
  • 数据划分
    • 训练集:来自 CC12M、DataComp 12M、YFCC15M。
    • 验证集:来自 MS COCO。

数据格式与存储

  • 文件格式:Parquet,采用 ZSTD 压缩。
  • 图像存储:图像以 JPEG 格式编码(质量90),以 Hugging Face 的 Image 列格式存储为字节数据。
  • 分片:每个分片包含约 100,000 行数据,便于分布式处理。

数据特征(字段)

每条记录包含以下字段:

字段名 数据类型 说明
image Image 图像数据(字节编码)
caption string 图像的文本描述
source string 原始来源数据集名称
split string 数据划分(train/val)
image_id string 图像唯一标识符
source_index int64 来源数据集的索引
source_dataset string 完整来源数据集名称
source_split string 来源数据集中的划分
source_url string 图像的原始下载链接
filename string 文件名
width int32 图像宽度(像素)
height int32 图像高度(像素)
image_sha256 string 图像的 SHA-256 哈希值
caption_index int32 标题在该图像下的索引

数据处理参数

  • 最小图像尺寸:16 像素(小于此尺寸的图像被过滤)。
  • 下载重试:最多 5 次下载重试,4 次 URL 重试。
  • 并行处理:16 个进程用于数据生成,8 个进程用于下载。
  • 日志间隔:每处理 10,000 条记录输出一次日志。

适用场景

  • 多模态模型(如 CLIP、BLIP 等)的预训练或微调。
  • 图像-文本对比学习、图像生成等任务。
搜集汇总
数据集介绍
WebMix-38M 数据集图片
构建方式
WebMix-38M数据集是基于大规模多源图像-文本对构建的综合性语料库。其构建过程整合了CC12M、DataComp12M、YFCC15M与MSCOCO四个经典数据源,通过精细化的数据管道将原始URL下载为JPEG格式图像,并采用Zstd压缩以Parquet格式存储。生成过程中设定了严格的筛选条件,例如最小图像尺寸为16像素、JPEG质量为90,并支持断点续传与多进程并行下载,最终形成包含训练集与验证集的结构化数据。每个样本均保留了来源标识、图像哈希值、尺寸及原始URL等元信息,确保了数据可追溯性与后续处理的灵活性。
特点
该数据集的核心特点在于其异质性融合与元数据完备性。数据来源于不同领域与风格的图像-文本对,涵盖了自然场景、概念描述与社交媒体内容,显著提升了多模态模型的泛化能力。特征设计中包含了图像、文本描述、来源标签、分裂标识、图像ID、来源索引、来源数据集、来源分裂、来源URL、文件名、宽高、图像SHA256哈希以及描述索引等14个字段,这种多维度的元数据体系使得研究者能够进行细粒度的数据过滤与离线分析。此外,图像以Hugging Face Image列格式直接嵌入,简化了加载流程,降低了数据处理门槛。
使用方法
使用WebMix-38M数据集时,可借助Hugging Face的datasets库直接加载Parquet文件,通过指定split参数获取训练集(train)或验证集(val)。数据集默认以流式方式读取,支持分片处理以适应大规模训练场景。研究人员可根据实际需求,利用元字段如source或source_dataset进行数据子集筛选,或通过图像哈希值实现去重。对于多模态模型的预训练与评估,建议将图像字段转换为张量格式,并结合文本描述构建标准输入流水线。该数据集无需额外下载原始文件,所有资源均已编码为字节形式,极大简化了数据管线搭建流程。
背景与挑战
背景概述
WebMix-38M数据集诞生于大规模多模态预训练蓬勃发展的背景下,由研究团队为弥补高质量图文数据集的稀缺而精心构建。该数据集整合了CC12M、DataComp12M、YFCC15M及MSCOCO四大经典来源,通过系统化筛选与统一格式处理,生成了约3800万条图像-文本对,旨在为视觉-语言模型提供更广泛、更均衡的训练支撑。其设计充分考虑到了数据多样性与可扩展性,为后续的对比学习、跨模态检索等任务奠定了坚实基础,成为推动多模态领域研究的重要数据资源。
当前挑战
数据集面临的首要挑战是如何在融合多源异构数据时保持语义一致性与噪声控制,这直接关系到下游模型的泛化能力。构建过程中,需应对不同来源的图像质量差异、文本描述冗余或缺失、以及版权合规等复杂问题。此外,数据量级的膨胀对存储、压缩与高效加载提出了技术难题,如采用Zstd压缩及JPEG质量控制在降低空间占用与维持视觉保真度间的权衡,是确保数据集实用性的关键。
常用场景
经典使用场景
WebMix-38M数据集整合了CC12M、DataComp12M、YFCC15M以及MSCOCO等多个大规模图文数据源,构建了包含约3800万图像-文本对的庞大多模态语料库。其经典使用场景在于作为预训练阶段的核心数据支撑,广泛应用于视觉-语言模型的对比学习训练,如CLIP系列及其衍生架构。研究者通常利用该数据集进行图文表征对齐的预训练,通过大规模弱监督信号学习视觉与语言模态间的映射关系,从而提升模型在下游任务中的泛化能力。
解决学术问题
该数据集旨在解决大规模图文数据获取成本高昂与异构数据融合困难等学术挑战。过往研究往往受限于单一数据源的规模与噪声,导致模型在跨域场景下性能骤降。WebMix-38M通过统一格式整合多源异构数据,为学术界提供了一套标准化、高质量且规模充足的研究基座。它有效缓解了数据分布偏差对模型鲁棒性的影响,推动了大规模多模态预训练范式的演进,并为数据组成比例与模型性能之间的关联分析提供了关键实验平台。
衍生相关工作
基于WebMix-38M数据集,学术界衍生出多项里程碑式的工作。OpenAI的CLIP模型训练即采用类似规模的数据混合策略,后续的DataComp系列基准测试则专门探讨了数据质量与规模对对比学习的影响。SigLIP、EVA-CLIP等高效视觉-语言模型均在此类数据上进行消融研究,探索分组对比损失与数据配比优化。此外,多模态扩散模型如Stable Diffusion也在其训练管线的早期阶段引入类似数据源,用以强化文本到图像生成的语义对齐能力,进一步验证了WebMix-38M所代表的混合数据范式在生成任务中的普适价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务