遇见数据集

Neomi26/cc12m-images-012

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

cc12m-images-012是CC12M数据集的一个子集,包含90,000张图像。这些图像以单独的JPEG文件形式重新托管,便于通过浏览器访问。数据集提供了图像URL模式、清单文件(manifest.parquet)包含键、图像URL、源URL、标题、宽度、高度、原始宽度、原始高度、分片、仓库和路径等列信息。该数据集是Neomi26/cc12m-images-NNN系列的一部分(约131个仓库),原始数据集为pixparse/cc12m-wds。

cc12m-images-012 is a subset of the CC12M dataset, containing 90,000 images re-hosted as individual JPEG files for browser access. It includes an image URL pattern and a manifest file (manifest.parquet) with columns: key, image_url, source_url, caption, width, height, original_width, original_height, shard, repo, path. This dataset is part of the Neomi26/cc12m-images-NNN series (approximately 131 repos total), with the original dataset being pixparse/cc12m-wds.

提供机构:
Neomi26
搜集汇总
数据集介绍
Neomi26/cc12m-images-012 数据集图片
构建方式
该数据集源自Conceptual 12M(CC12M)大规模图文语料库,是对原始pixparse/cc12m-wds数据集的进一步处理与优化。构建过程中,研究团队从CC12M中筛选出约9万张图像,将原本以WebDataset格式存储的数据重新托管为独立的JPEG文件,以便于浏览器直接访问。所有图像按照统一命名规则组织,并存放于对应的文件夹中,同时提供了包含关键元数据的manifest.parquet清单文件,涵盖图像键值、图像链接、来源URL、图文描述、尺寸信息及数据切片归属等内容,从而实现了从大规模分布式数据到结构化、易调用数据集的平滑转换。
特点
cc12m-images-012的核心特色在于其高度模块化与易用性。作为Neomi26/cc12m-images-*系列122个数据仓库之一,该数据集以独立JPEG文件形式呈现,彻底消除了对特定存储格式的依赖,显著降低了图像访问门槛。90,000张图像配以详细的清单文件,不仅记录了图像视觉属性(如宽、高、原始分辨率),还保留来源URL与对应的文本描述,使图像-文本对之间的映射关系清晰可溯。这种设计兼顾了数据完整性、可扩展性与检索效率,尤其适合需要快速加载与轻量级部署的图像理解或跨模态研究场景。
使用方法
使用cc12m-images-012时,研究者可直接通过统一URL模式(https://huggingface.co/datasets/Neomi26/cc12m-images-012/resolve/main/{folder}/{key}.jpg)获取单张图像,无需额外下载工具或复杂配置。利用manifest.parquet文件,用户能够便捷地按需筛选并索引整个数据集,例如根据尺寸、描述关键词或数据来源进行检索。此外,通过全局索引Neomi26/cc12m-images-index,可以跨仓库定位任意图像,实现全系列12万张图像的无缝访问与整合,极大提升了在大规模图文数据集上进行实验与模型训练的便捷性。
背景与挑战
背景概述
在大规模多模态学习研究中,图文对齐与视觉语言预训练模型的性能高度依赖于高质量、海量的图像-文本配对数据。CC12M数据集于2021年由Google Research等机构发布,旨在通过从网页中自动抓取并过滤得到约1200万张图片及其描述文本,为对比学习、图像生成等任务提供基础资源。作为该数据集的子集,cc12m-images-012由研究者Neomi26重新托管,以独立JPEG文件形式存储9万张图像,便于浏览器直接访问和轻量级实验。该数据集的构建降低了原始复杂格式(如WebDataset)的使用门槛,促进了社区对CC12M数据的二次开发与评估,对图像描述、多模态检索等领域的研究具有显著推动作用。
当前挑战
当前数据集所应对的领域挑战主要源于互联网噪声文本对视觉语言对齐的干扰:原始CC12M中的描述常包含不相关、冗余或模糊信息,导致模型学习到的图文映射鲁棒性不足。构建过程中的挑战则包括:一是从原始WebDataset格式中高效提取并验证12亿张图像的完整性,需解决网络传输中断与数据损坏问题;二是对9万张图像进行重托管时,需维护原图分辨率、宽高比等元数据的准确性,并确保与原始数据集的长尾分布一致;三是跨122个仓库的分布式存储(cc12m-images-000至121)增加了索引一致性维护的复杂度,需借助全局索引文件实现高效检索与去重。
常用场景
经典使用场景
CC12M作为一个大规模图文对数据集,其子集cc12m-images-012在视觉与语言多模态研究领域扮演着基础性角色。该数据集最经典的使用场景是作为预训练语料,用于训练图像描述生成、视觉问答以及文本到图像检索等跨模态理解模型。研究者常利用其丰富且多样化的图像与对应文本描述,构建能够学习图像语义与自然语言之间映射关系的深度神经网络,从而提升模型在零样本或少样本场景下的泛化能力。
实际应用
在实际应用层面,cc12m-images-012所支撑的模型广泛部署于智能审核、电商推荐、无障碍阅读等场景。例如,基于该数据集训练的图文匹配系统可自动为产品生成描述文本或根据用户查询返回相关图像;在内容安全领域,此类模型能够理解图像与文字之间的语义关联,从而精准识别违规信息。此外,它也被集成到辅助视觉障碍者的语音描述工具中,极大拓展了AI技术的普惠价值。
衍生相关工作
该数据集衍生了一系列影响深远的经典工作,包括CLIP、ALIGN等开创性模型的训练与评测。这些工作利用CC12M等大规模图文对,验证了基于对比学习的视觉-语言联合表征策略的有效性,并催生了如BLIP、Flamingo等后续模型。此外,基于cc12m-images-012的子集实验为数据筛选策略、噪声标签处理以及有偏分布下的模型鲁棒性研究提供了基准,推动了多模态预训练范式的持续演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务