遇见数据集

Neomi26/cc12m-images-022

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

这是一个CC12M数据集的子集,名为cc12m-images-022,包含90,000张图像,这些图像已重新托管为单独的JPEG文件,便于通过浏览器访问。数据集支持图像到文本任务,每张图像配有元数据,包括标题、尺寸和来源URL等。图像URL遵循特定模式,清单文件为Parquet格式,包含键、图像URL、源URL、标题、宽度、高度、原始宽度、原始高度、分片、仓库和路径等列。该数据集是Neomi26/cc12m-images-NNN系列的一部分,总共有约131个仓库,并链接到全局索引。

This is a subset of the CC12M dataset named cc12m-images-022, containing 90,000 images re-hosted as individual JPEG files for browser access. The dataset is designed for image-to-text tasks, with each image accompanied by metadata such as caption, dimensions, and source URL. The image URLs follow a specific pattern, and the manifest file is in Parquet format, including columns like key, image_url, source_url, caption, width, height, original_width, original_height, shard, repo, and path. It is part of the Neomi26/cc12m-images-NNN series, totaling approximately 131 repositories, and is linked to a global index.

提供机构:
Neomi26
搜集汇总
数据集介绍
Neomi26/cc12m-images-022 数据集图片
构建方式
该数据集源自广受关注的CC12M大规模图像-文本对集合,旨在为多模态学习研究提供便捷的视觉数据访问途径。其构建方式为:从原始CC12M数据集中精选出一部分图像,并将其重新托管为独立的JPEG文件。每个图像均保留原有的元数据信息,如唯一键值、原始来源URL、对应文本描述以及图像尺寸等。这些图像被整理成90,000个独立的JPEG文件,并按照文件夹结构进行组织,使得用户可以通过规范的URL模式直接访问每一张图像,从而降低了数据加载与预处理的复杂度。
特点
该数据集的核心特点在于其高度的可访问性与结构化组织。所有图像均以标准JPEG格式独立存储,用户可直接通过浏览器或编程方式访问特定图像,无需处理复杂的WebDataset格式。数据集提供了一份详尽的清单文件(manifest.parquet),其中包含了图像键值、URL、原始来源、文本描述、多种尺寸信息以及所属分片等关键字段,极大地方便了数据检索与筛选。作为Neomi26/cc12m-images-NNN系列的一部分,该数据集与其他子集共同构成了一个包含约131个仓库的完整图像索引体系。
使用方法
使用者可通过清单文件中的图像URL直接下载或读取图像,例如利用PIL库加载图像进行可视化或预处理。该数据集适用于图像描述生成、多模态检索、视觉语言预训练等任务。用户可以结合清单中的文本描述字段构建图像-文本对,用于训练或评估多模态模型。此外,通过全局索引仓库可访问整个系列的所有图像子集,实现大规模数据的灵活组合与使用。
背景与挑战
背景概述
cc12m-images-022 是 Conceptual 12M(CC12M)数据集的一个子集,后者由 Google 研究团队于 2021 年创建,旨在为图像-文本多模态模型提供大规模、高质量的训练数据。该数据集从网络抓取了约 1200 万张图像及其对应描述,核心研究问题在于如何通过弱监督学习,利用图文对齐关系提升跨模态理解与生成能力。作为 CC12M 的镜像子集,cc12m-images-022 由 Neomi26 团队负责重新托管为独立 JPEG 文件,共包含 90,000 张图像,并附带详细清单文件以支持浏览器访问与索引查询。该系列数据集在视觉语言预训练(如 CLIP、BLIP 等模型)中扮演了关键角色,有效推动了零样本分类、图像检索及图像描述生成等任务的性能提升。
当前挑战
该数据集所解决的领域问题在于大规模图文对的弱对齐学习:从开放网络中爬取的图像与文本常存在语义不匹配、噪声多、长尾分布明显等挑战,亟需有效的数据筛选与清洗策略。在构建过程中,cc12m-images-022 面临了图像链接失效、存储与分发效率低、元数据一致性维护等实际困难。例如,原始 CC12M 中的许多 URL 已不可访问,因此该子集通过重新托管为 JPEG 文件并建立分布式仓库(共约 131 个仓库)来保障图像的可获取性;同时需维护图像尺寸、原始 URL 及分片信息等字段,以支撑后续的数据索引与模型复现,这对存储架构与数据处理管线提出了较高要求。
常用场景
经典使用场景
cc12m-images-022作为CC12M数据集的一个子集,在视觉与语言多模态研究领域扮演着基石角色。研究者常将其用于图像-文本匹配任务的训练与评估,通过利用其丰富的图文对数据,对模型在跨模态语义理解上的能力进行精细调校。该数据集以其大规模的图像和对应的英文描述,成为推动多模态预训练模型发展的重要数据支撑。
实际应用
在实际应用层面,cc12m-images-022广泛服务于智能图像搜索引擎的优化与多模态内容审核系统的开发。企业可利用该数据集训练模型,以实现从海量互联网图像中精准识别与特定文本描述相符的视觉内容,进而提升产品推荐、广告匹配等商业场景中的用户交互体验。此外,其在辅助视觉障碍人士的图像理解应用中也展现出潜在价值。
衍生相关工作
基于该数据集,衍生出了一系列旨在提升多模态理解深度的经典工作,如CLIP、ALIGN等模型在预训练阶段均离不开CC12M及其子集的数据支撑。这些工作进一步探索了图文联合表征的鲁棒性与泛化能力,并催生了诸如零样本分类、开放词汇目标检测等更复杂的下游任务。cc12m-images-022本身也常被用作评估图像描述生成质量的重要基准数据集。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务