遇见数据集

Neomi26/cc12m-images-016

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是CC12M数据集的一个子集,包含90,000张图像,这些图像被重新托管为单独的JPEG文件,以方便通过浏览器直接访问。图像URL遵循特定模式:https://huggingface.co/datasets/Neomi26/cc12m-images-016/resolve/main/{folder}/{key}.jpg。数据集还提供一个清单文件(manifest.parquet),其中包含key、image_url、source_url、caption、width、height、original_width、original_height、shard、repo、path等列,用于记录图像的元数据。这是Neomi26/cc12m-images-NNN系列的一部分(总计约131个仓库),原始数据集为pixparse/cc12m-wds。

This dataset is a subset of the CC12M dataset, re-hosted as individual JPEG files for browser access. It contains 90,000 images, with an image URL pattern: https://huggingface.co/datasets/Neomi26/cc12m-images1-016/resolve/main/{folder}/{key}.jpg. A manifest file (manifest.parquet) is included, with columns: key, image_url, source_url, caption, width, height, original_width, original_height, shard, repo, path. It is part of the Neomi26/cc12m-images-NNN series (~131 repos total), and the original dataset is pixparse/cc12m-wds.

提供机构:
Neomi26
搜集汇总
数据集介绍
Neomi26/cc12m-images-016 数据集图片
构建方式
cc12m-images-016 数据集源自广受关注的 CC12M 大规模图文语料库,由原始数据经重新托管而成。具体而言,该数据集从 pixparse/cc12m-wds 子集中提取出 90,000 张图像,并将其转换为独立的 JPEG 文件格式,部署于 HuggingFace 仓库中以实现浏览器端的便捷访问。图像资源采用结构化路径存储,URL 模式为 https://huggingface.co/datasets/Neomi26/cc12m-images-016/resolve/main/{folder}/{key}.jpg,便于程序化检索与加载。此外,数据集附带了 manifest.parquet 清单文件,记录了每张图像的键值、图像 URL、源 URL、对应文本描述、图像尺寸、原始尺寸、分片归属、仓库信息及本地路径等多维元数据,为后续研究提供了坚实的数据溯源基础。作为 Neomi26/cc12m-images-* 系列(共计 122 个数据仓库)中的一部分,该数据集与其他编号从 000 至 121 的镜像库协同,共同构建了一个大规模、分布式的图像索引体系。
特点
该数据集的核心特点在于其高度结构化与跨域一致性。首先,所有图像均以统一的 JPEG 编码格式存储,确保了跨平台与跨浏览器的兼容性与加载效率。其次,通过引入详细的多维度元数据清单,研究者能够快速追溯每张图像的原始来源、文本描述及物理尺寸,从而支持图像质量筛选、数据清洗及多模态模型的训练任务。此外,作为 CC12M 的子集,该数据集保留了原始语料库中丰富且多样的图文对,涵盖了自然场景、物体、活动及抽象概念等多类视觉与语言内容,为对比学习、图像描述生成及视觉问答等前沿研究提供了可靠的训练与评估基础。与此同时,其采用分片式索引(shard)与全局索引(global index)相结合的架构,进一步提升了数据在大规模分布式系统中的可管理性与并行读取能力。
使用方法
使用 cc12m-images-016 数据集时,研究者可通过清单文件 manifest.parquet 高效定位并访问所需图像。具体流程包括:首先利用 pandas 或 pyarrow 等库解析 Parquet 格式的元数据,获取图像键值、URL 及对应文本描述等信息;随后,根据图像 URL 模式直接通过 HTTP 请求下载 JPEG 文件,或者利用 HuggingFace Datasets 库的加载器进行流式读取,以降低本地存储压力。对于多模态模型训练,可基于 caption 列中的文本描述与图像特征构建图文对输入。同时,该数据集支持按 shard 字段进行数据划分,便于实现分布式训练中的分片加载与混洗策略。此外,结合全局索引 Neomi26/cc12m-images-index,用户可在整个 122 仓库的规模上进行数据检索与子集选取,从而灵活适配不同场景下的数据需求。
背景与挑战
背景概述
在大规模多模态学习领域,图文数据的规模与质量直接决定了预训练模型的性能上限。CC12M是一个广泛使用的包含1200万图文对的英文数据集,由谷歌研究人员于2021年提出,旨在通过过滤网络爬取的图像与替代文本构建大规模训练集。cc12m-images-016作为该数据集的子集之一,由研究团队Neomi26对原始CC12M数据重新托管并以独立JPEG文件格式发布,共包含90,000张图像。该子集被组织为122个仓库系列中的第16号,提供了便捷的浏览器访问路径和详细的清单文件,便于研究者高效检索和使用,对推动多模态模型在图像理解任务中的发展具有重要意义。
当前挑战
CC12M所解决的领域问题在于如何从海量嘈杂的网络数据中筛选出与文本语义对齐的高质量图像-描述对,但其构建过程面临多重挑战。首先,原始数据来源于网页抓取,图像链接失效率高,且替代文本往往存在噪声、不完整或与图像内容偏差等问题,需设计复杂的清洗与过滤流程。其次,cc12m-images-016子集将图像重新托管为JPEG文件,这要求在存储和带宽成本、数据完整性及访问速度之间取得平衡。此外,跨多个仓库的统一索引管理、图像尺寸多样性以及元数据标准化也是实际构建中必须克服的技术障碍。
常用场景
经典使用场景
在视觉与语言多模态学习领域,cc12m-images-016作为Conceptual 12M(CC12M)数据集的一个子集,凭借其精心整理的九万张JPEG图像与对应的文本描述,成为图像描述生成、视觉语义对齐以及跨模态检索等任务的经典训练与评估资源。研究者利用该数据集的图像-文本对,训练模型学习从视觉内容到自然语言的映射关系,例如基于Transformer架构的图像描述模型或对比学习框架下的视觉语言预训练模型,从而在零样本分类、图像理解等任务上取得突破。
解决学术问题
该数据集有效缓解了大规模多模态数据集构建中的两大核心问题:数据可访问性与标准化程度。原始CC12M数据集以WebDataset格式存储,而cc12m-images-016将其重新托管为独立的JPEG文件,并通过清晰的目录结构和Parquet清单文件提供元数据,使得数据获取更加高效。这一举措促进了多模态学习领域的可复现性研究,使研究人员能够专注于模型设计而非数据预处理,推动了从视觉语言预训练到细粒度语义匹配等学术问题的深入探索。
衍生相关工作
cc12m-images-016作为CC12M生态系统的组成部分,推动了多项经典工作的衍生与迭代。其中最著名的是CLIP(Contrastive Language-Image Pre-training)风格的对比学习模型,其训练数据常包含CC12M子集。此外,基于该数据集的改进版本如BLIP、ALBEF等视觉语言预训练模型,通过引入噪声鲁棒性训练或细粒度跨模态对齐技术,显著提升了在下游任务中的表现。这些工作共同奠定了现代多模态人工智能的基础范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务