遇见数据集

Neomi26/cc12m-images-023

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

cc12m-images-023是CC12M数据集的一个子集,包含90,000张图像,这些图像被重新托管为单独的JPEG文件,以便于浏览器访问。图像URL模式为`https://huggingface.co/datasets/Neomi26/cc12m-images-023/resolve/main/{folder}/{key}.jpg`。清单文件`manifest.parquet`包含以下列:`key`、`image_url`、`source_url`、`caption`、`width`、`height`、`original_width`、`original_height`、`shard`、`repo`、`path`。该数据集是Neomi26/cc12m-images-NNN系列的一部分(总计约131个仓库),原始数据集为pixparse/cc12m-wds。

cc12m-images-023 is a subset of the CC12M dataset, consisting of 90,000 images re-hosted as individual JPEG files for browser access. The image URL pattern is `https://huggingface.co/datasets/Neomi26/cc12m-images-023/resolve/main/{folder}/{key}.jpg`. The manifest file `manifest.parquet` includes columns: `key`, `image_url`, `source_url`, `caption`, `width`, `height`, `original_width`, `original_height`, `shard`, `repo`, `path`. It is part of the `Neomi26/cc12m-images-NNN` series (approximately 131 repos total), with the original dataset being pixparse/cc12m-wds.

提供机构:
Neomi26
搜集汇总
数据集介绍
Neomi26/cc12m-images-023 数据集图片
构建方式
cc12m-images-023数据集源自广为人知的CC12M大规模图文数据集,后者以互联网图像与对应文本描述为核心资源。为提升数据获取的便捷性与兼容性,本子集将原始以WebDataset格式存储的图像重新托管为独立的JPEG文件,并统一部署于浏览器可直连的云端存储中。每个图像均通过标准化的URL模式进行访问,同时附带一份详尽的数据清单文件(manifest.parquet),其中记录了每个样本的唯一键值、图像链接、原始来源、文本描述、图像尺寸及所属分片等元信息。整个构建过程严格遵循原始数据的划分逻辑,确保了与CC12M全集之间的内容映射与溯源一致性。
特点
本数据集在保留CC12M核心内容的基础上,呈现出三大显著特征。其一,图像体量精准控制在9万张,属于中等规模子集,兼具数据丰富性与存储可管理性。其二,采用独立JPEG文件格式与直接URL访问机制,极大降低了在浏览器环境或轻量级脚本中加载与预览的门槛,无需依赖特定的数据加载库。其三,配套的清单文件提供了多维度的元数据字段,包括原始尺寸、目标尺寸、分片归属及信息库路径,为后续的数据筛选、质量评估或并行处理提供了结构化支撑。
使用方法
用户可通过清单文件(manifest.parquet)快速检索所需样本,利用其中提供的图像URL字段直接下载JPEG图像文件。由于图像地址遵循固定的`https://huggingface.co/datasets/.../resolve/main/...`模式,也可通过编程方式批量构建URL列表进行非顺序访问。该数据集适合用于图像描述生成、多模态检索或视觉语言预训练模型的数据增强场景。此外,本子集属于Neomi26/cc12m-images-NNN系列之一,建议结合全局索引数据集(cc12m-images-index)实现跨子集的数据联合查询与随机采样。
背景与挑战
背景概述
cc12m-images-023数据集是对Conceptual 12M(CC12M)大规模图文配对数据集的子集进行重构与重托管的结果。CC12M数据集由Google Research等机构于2020年前后推出,核心研究目标在于构建一个包含约1200万条图像-文本对的、可用于多模态视觉语言预训练的大规模语料库。该数据集的提出有效缓解了高质量人工标注图文数据匮乏的问题,推动了CLIP、ALIGN等对比学习模型在零样本分类、图像检索等任务上的突破性进展。作为CC12M的衍生版本,cc12m-images-023将原始WebDataset格式的图片重新存储为独立的JPEG文件,以便于浏览器端直接访问,降低了研究者获取和可视化数据的门槛,进一步扩大了该数据集在学术界与工业界的影响力。
当前挑战
cc12m-images-023所面对的领域挑战首先源于CC12M本身所解决的图文匹配与多模态预训练核心问题:互联网来源的图文对通常包含噪声,如文本描述与图像内容不匹配、语义模糊或包含干扰信息,这给模型学习鲁棒的跨模态对齐带来了困难。在数据集构建层面,挑战体现在多个环节:原始CC12M采集自数百亿候选图文对,需经过基于图像和文本质量、内容安全性的多级过滤与去重;本子集进一步面临存储格式转换带来的元数据一致性与图像完整性校验问题;此外,作为约131个子集系列的一部分,还需维护跨仓库的全局索引,确保用户能够高效地查询和组合不同子集中的图片,这对数据治理与分布式存储架构提出了较高要求。
常用场景
经典使用场景
cc12m-images-023是Conceptual Captions(CC12M)数据集的一个子集,专为图像-文本配对任务而设计。该数据集包含90,000张以JPEG格式存储的图像,每张图像均附有对应的文本描述。在经典使用场景中,研究者利用这些图文对来训练和评估多模态模型,例如CLIP、ALIGN等视觉-语言预训练模型。通过将图像与自然语言描述对齐,该数据集成为跨模态表征学习的重要基石,广泛用于图像检索、图像描述生成以及视觉问答等基础研究的基准测试。
解决学术问题
该数据集有效解决了大规模图文数据获取与预处理中的两个关键学术问题:一是原始CC12M数据集以WebDataset格式存储,研究者需要额外的数据解析技术才能直接访问;二是图像链接失效率高,影响实验可重复性。cc12m-images-023通过将图像重新托管为独立JPEG文件并提供parquet格式的清单文件,显著降低了数据访问门槛。这一举措促进了视觉-语言模型中监督对比学习、跨模态注意力机制等核心算法的验证,推动了多模态领域从理论探索向实证研究的转化。
衍生相关工作
基于cc12m-images-023及其所属的系列数据集,学术界衍生出多项经典工作。其中,CLIP的零样本分类能力验证常以CC12M为预训练数据源;BLIP系列模型在图像描述生成任务中将其作为微调数据的补充来源;此外,NoiseCLIP和Debiased CLIP等算法通过分析该数据集中的噪声图文对,提出了鲁棒性更强的人机对齐训练策略。这些衍生工作不仅深化了对比学习范式的理论理解,还催生了面向特定垂直领域(如医学影像、遥感图像)的多模态模型适配方法。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务