遇见数据集

Neomi26/cc12m-images-001

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

cc12m-images-001是CC12M数据集的一个子集,包含89,262张重新托管为独立JPEG文件的图像,便于通过浏览器直接访问。该数据集提供了详细的清单文件(manifest.parquet),包含图像的关键信息,如键值、图像URL、源URL、标题、宽度、高度、原始尺寸、分片、仓库和路径。图像URL遵循特定模式:https://huggingface.co/datasets/Neomi26/cc12m-images-001/resolve/main/{folder}/{key}.jpg。此数据集是Neomi26/cc12m-images-NNN系列的一部分(总计约131个仓库),并关联到原始数据集pixparse/cc12m-wds。

cc12m-images-001 is a subset of the CC12M dataset consisting of images re-hosted as individual JPEG files for browser access. It contains 89,262 images with a specific URL pattern: https://huggingface.co/datasets/Neomi26/cc12m-images-001/resolve/main/{folder}/{key}.jpg. The dataset includes a manifest file (manifest.parquet) with columns: key, image_url, source_url, caption, width, height, original_width, original_height, shard, repo, and path. It is part of the Neomi26/cc12m-images-NNN series (approximately 131 repos total) and is derived from the original dataset pixparse/cc12m-wds.

提供机构:
Neomi26
搜集汇总
数据集介绍
Neomi26/cc12m-images-001 数据集图片
构建方式
cc12m-images-001 数据集源自经典的 CC12M 大规模图文对数据集,由原始 WebDataset 格式中的图像数据经过重新提取与格式转换而构建。为了便于浏览器直接访问与可视化展示,所有图像被独立保存为 JPEG 文件,并按照统一命名规则组织在多级文件夹中。每张图像对应一个唯一标识键(key),并附带包含图像链接、原始来源 URL、文本描述、尺寸信息及所属分片等详细元数据的清单文件 manifest.parquet,从而在保留原始数据关联性的同时极大提升了单张图像的调用效率。该数据集是 Neomi26/cc12m-images-* 子集系列中的第一个,完整系列涵盖 122 个仓库,覆盖约 89000 余张图像。
特点
本数据集最突出的特征在于其对原始大规模图文数据集进行轻量化、网页友好的独立图像文件重组织,弥补了传统 WebDataset 格式在浏览器端访问不便的局限。每个子集图像数量控制在数万张级别,既保证了足够的数据规模用于模型训练与验证,又便于研究者进行局部采样与快速数据浏览。此外,数据集中内置了详尽的 manifest.parquet 元数据文件,完整记录了每张图像的来源、尺寸、描述与分片归属,为数据溯源、统计分析和筛选过滤提供了可靠依据。跨 122 个仓库的分布式存储结构与全局索引的存在,进一步增强了数据集的可扩展性与灵活性。
使用方法
使用该数据集时,研究者可直接通过公开的 HTTPS URL 模式按需访问任意单张图像,无需下载整个 WebDataset 归档文件。具体的图像链接格式为 https://huggingface.co/datasets/Neomi26/cc12m-images-001/resolve/main/{folder}/{key}.jpg ,其中 folder 与 key 可由 manifest.parquet 中的 'key' 字段及其对应的文件夹映射关系得到。推荐首先加载并解析 manifest.parquet 文件,获取全部图像的元数据条目,随后依据研究任务(如图文匹配训练、图像检索或描述生成)对 caption 字段进行过滤或直接构建输入样本。对于需要全量数据的场景,可结合全局索引仓库 Neomi26/cc12m-images-index 实现跨子集的统一调度与批量加载。
背景与挑战
背景概述
在大规模多模态学习的浪潮中,Conceptual 12M(CC12M)数据集应运而生,由Google Research等机构于2021年左右发布,旨在为图像-文本匹配与多模态预训练提供海量弱监督数据。该数据集通过特定过滤流程从网络抓取图文对,涵盖约1200万样本,显著推动了CLIP、ALIGN等模型的训练与性能提升。cc12m-images-001作为CC12M的子集,由研究者Neomi26重新托管为可直接浏览的JPEG文件,包含89,262张图像,属于cc12m-images系列(共122个仓库)的一部分。其核心研究问题在于如何便捷地访问和复用原始CC12M数据,尤其针对浏览器端与应用开发场景,从而降低多模态研究中数据获取的门槛。
当前挑战
CC12M数据集旨在解决弱监督图文对构建的领域问题——即如何在缺乏人工精细标注的情况下,从互联网海量数据中高效获取可用于多模态预训练的高质量配对数据。然而,原始CC12M依赖URL链接,存在链接失效、下载缓慢等资源访问不稳定问题。cc12m-images-001的构建过程直面这一挑战,将所有图像统一转化为JPEG格式并托管于HuggingFace,确保数据长期可用性。此外,系列仓库数据分散在122个repo中,索引与整合需要额外管理开销,且单repo样本量(10K-100K)限制了直接大规模训练的便利性。图像分辨率、原始URL时效性差异以及版权合规性依然是潜在的隐性障碍。
常用场景
经典使用场景
CC12M数据集作为大规模图文对数据的重要来源,其子集cc12m-images-001常用于多模态预训练模型的训练与评估。研究者可借助该数据集中近九万张高质量图像及其对应的英文描述文本,构建视觉-语言联合表示学习任务。经典的使用方式包括利用图像和文本的匹配关系进行对比学习,训练诸如CLIP、ALIGN等双塔模型,或作为图像描述生成、文本到图像检索等下游任务的基准数据集。该子集以JPEG格式重新托管,极大地方便了浏览器端的直接访问与快速实验迭代。
解决学术问题
在学术研究中,cc12m-images-001子集有效解决了大规模图文数据获取与存储的瓶颈问题。原始CC12M数据集包含超过1200万图文对,但分散存储在多个WebDataset格式的文件中,给不具备分布式存储条件的研究团队带来访问困难。该子集通过整理并重新托管为独立JPEG文件,显著降低了数据使用的门槛,使中小型实验室也能参与多模态研究。它支持对图文语义对齐、跨模态迁移学习、以及零样本分类等前沿问题的探索,推动了视觉与语言领域基础模型的泛化能力研究。
衍生相关工作
围绕CC12M数据集衍生了一系列经典研究工作,该子集作为其组成部分同样承载着这些成果的价值。典型代表包括OpenAI的CLIP模型在预训练阶段使用了CC12M数据,验证了大规模弱监督图文数据的有效性;谷歌的ALIGN模型同样依赖于类似规模的图文对数据来实现跨模态对齐。此外,基于CC12M数据训练的中文多模态模型如Chinese-CLIP,在跨语言任务中展现了优异性能。在图像描述生成领域,研究者利用该数据集微调模型以提升描述质量;在视觉问答任务中,其图文对结构为构建问题-答案对提供了基础素材。这些工作共同推动了多模态学习的快速发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务