遇见数据集

Neomi26/cc12m-images-007

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

cc12m-images-007是CC12M数据集的一个子集,包含90,000张图像,这些图像被重新托管为单独的JPEG文件,以便于通过浏览器直接访问。图像URL遵循特定模式:`https://huggingface.co/datasets/Neomi26/cc12m-images-007/resolve/main/{folder}/{key}.jpg`。数据集提供清单文件`manifest.parquet`,包含以下列:`key`(图像键)、`image_url`(图像URL)、`source_url`(源URL)、`caption`(标题)、`width`(宽度)、`height`(高度)、`original_width`(原始宽度)、`original_height`(原始高度)、`shard`(分片)、`repo`(仓库)、`path`(路径)。该数据集是Neomi26/cc12m-images-NNN系列的一部分,该系列共有约131个仓库,全局索引可通过Neomi26/cc12m-images-index访问。原始数据集为pixparse/cc12m-wds,主要用于图像到文本任务,标签包括cc12m和images,规模类别为10K到100K之间。

cc12m-images-007 is a subset of the CC12M dataset, re-hosted as individual JPEG files for browser access. It contains 90,000 images with a URL pattern: `https://huggingface.co/datasets/Neomi26/cc12m-images-007/resolve/main/{folder}/{key}.jpg`. The manifest file `manifest.parquet` includes columns: `key`, `image_url`, `source_url`, `caption`, `width`, `height`, `original_width`, `original_height`, `shard`, `repo`, `path`. It is part of the `Neomi26/cc12m-images-NNN` series (approximately 131 repos in total), with a global index available at `Neomi26/cc12m-images-index`. The original dataset is pixparse/cc12m-wds, categorized under image-to-text tasks, with tags such as cc12m and images, and a size category of 10K to 100K.

提供机构:
Neomi26
搜集汇总
数据集介绍
Neomi26/cc12m-images-007 数据集图片
构建方式
cc12m-images-007数据集源自广受关注的Conceptual 12M(CC12M)大规模图文语料库,通过从原始WebDataset格式中提取并重新托管图像资源,以单个JPEG文件的形式呈现于浏览器可访问的存储空间中。该数据集共包含90,000张图像,每张图像均按文件夹与唯一键值进行编码,形成标准化的URL访问模式。此外,数据集还附带了manifest.parquet清单文件,其中详细记录了每张图像的键值、图像地址、来源URL、对应文本描述、尺寸信息及数据分片归属,为后续的检索与预处理提供了结构化支持。该系列共涵盖122个独立仓库,编号从cc12m-images-000至cc12m-images-121,此007子集即为其中一环,并通过全局索引仓库实现统一管理。
特点
cc12m-images-007的一大特色在于其极佳的浏览器兼容性与访问便捷性,将原本分散于WebDataset分片中的图像文件独立存储为可直接通过URL访问的JPEG格式,消除了特定框架或工具链的依赖,大幅降低了数据集的使用门槛。每个子集均与原始CC12M数据集保持一致的语义对应关系,图像所对应的自然语言描述、原始尺寸与处理后的尺寸信息均被完整保留。此外,该数据集通过多仓库分片管理策略,有效控制了单个仓库的存储规模,确保数据检索与下载的高效性。配合全局索引仓库,用户可跨越122个分库进行统一的横向查询与数据定位,实现了大规模图文数据集的结构化重组与轻量化分发。
使用方法
使用cc12m-images-007数据集时,可直接通过预定义的图像URL模板快速获取图像文件,例如将{key}与{folder}替换为清单文件中对应的字段值即可构建完整访问路径。用户亦可直接下载manifest.parquet清单文件,借助Pandas等数据处理库加载列式信息,包括图像URL、文本描述及尺寸属性,进而灵活构建图文对数据集以用于多模态模型训练。对于需要整合全部图像资源的场景,建议通过全局索引仓库Neomi26/cc12m-images-index获取跨仓库的元数据检索能力,从而批量定位分布于多个子集分库中的图像与描述信息。整套机制设计兼顾了小规模快速实验与大规模数据调度的双重需求。
背景与挑战
背景概述
cc12m-images-007是Conceptual 12M(CC12M)数据集的一个子集,该数据集由谷歌研究团队于2019年创建,旨在为多模态视觉与语言模型提供大规模图文配对数据。CC12M通过自动化管道从Web中提取了约1200万张图片及对应的文本描述,显著推动了图像描述、跨模态检索等任务的发展。作为该系列的第7个分片,cc12m-images-007由Neomi26重新托管为独立的JPEG文件,包含9万张图片及对应的元数据(如原始来源、文本描述、尺寸等),便于浏览器直接访问和实验研究。这一子集的释出进一步降低了高质量图文数据的使用门槛,对视觉语言预训练领域产生了深远影响。
当前挑战
面临的核心挑战包括:1)领域问题层面,CC12M旨在解决大规模图文配对数据的获取难题,但Web自动采集的噪声(如文本与图像关联不准确、低质量图像)需要复杂的过滤策略;2)构建过程中,由于原始CC12M以WebDataset格式存储,许多研究者受限于带宽和存储无法直接访问,cc12m-images-007通过重新托管为JPEG文件并提供统一URL模式,解决了数据可访问性和浏览器兼容性问题,但维护122个独立仓库的索引一致性与元数据完整性同样构成挑战。
常用场景
经典使用场景
CC12M作为一个大规模图文对数据集,在视觉与语言跨模态学习领域扮演着基石角色。其经典使用场景在于预训练视觉-语言模型,例如CLIP、ALIGN等架构,通过海量的图像与文本配对数据,让模型学习到图像语义与自然语言描述之间的深层关联。该数据集以其千万级别的样本规模,为对比学习范式提供了丰富的训练素材,使得模型能够在无需精细人工标注的情况下,习得鲁棒的视觉表征与跨模态对齐能力。
解决学术问题
该数据集的提出有效缓解了高质量图文配对数据稀缺的困境,为学术研究开辟了新的路径。它解决了传统监督学习依赖大量人工标注成本高昂的问题,以及小规模数据集上模型泛化能力不足的瓶颈。通过提供规模庞大、来源多样的图文对,CC12M推动了零样本学习、图像描述生成、跨模态检索等方向的研究进展,使得模型能够从互联网级别的弱监督信号中捕捉视觉与语言间的共性规律,显著提升了相关任务的性能上限与迁移能力。
衍生相关工作
围绕CC12M数据集,学术界衍生了一系列具有标杆意义的研究工作。例如,OpenAI的CLIP模型采用了与CC12M类似的大规模图文对比学习策略,重新定义了视觉表征的学习方式;随后,改进版本的模型如ViLT、ALBEF等进一步探索了更高效的多模态融合架构。在数据增强方面,研究者基于CC12M提出了过滤噪声配对策略的Filtering方法,提升了预训练数据的质量。这些衍生工作不仅深化了对弱监督跨模态学习的理解,也为后续Florence、BEiT-3等更统一的多模态基础模型奠定了坚实的数据与方法基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务