遇见数据集

Neomi26/cc12m-images-010

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

cc12m-images-010 是 CC12M 数据集的一个子集,包含 90,000 张图像,这些图像被重新托管为单独的 JPEG 文件,以便于通过浏览器直接访问。数据集提供了图像的 URL 模式、元数据清单(包括键、图像URL、源URL、标题、尺寸等信息),并且是 Neomi26/cc12m-images-NNN 系列数据集的一部分。原始数据集来源于 pixparse/cc12m-wds。

cc12m-images-010 is a subset of the CC12M dataset, containing 90,000 images. These images have been re-hosted as individual JPEG files for direct access via web browsers. The dataset provides image URL patterns and a metadata manifest, including details such as keys, image URLs, source URLs, captions, image dimensions and other relevant information. It is part of the Neomi26/cc12m-images-NNN series of datasets. The original dataset is sourced from pixparse/cc12m-wds.

提供机构:
Neomi26
搜集汇总
数据集介绍
Neomi26/cc12m-images-010 数据集图片
构建方式
cc12m-images-010是源自大型多模态数据集CC12M的一个子集,专为浏览器直接访问而重新托管。该数据集将原始WebDataset格式的图像转换为独立的JPEG文件,共包含90,000张图片。每张图像通过统一的URL模式访问,并附带详尽的清单文件manifest.parquet,记录了关键信息如密钥、图像URL、来源URL、文本描述、图像尺寸以及所属分片等。此数据集属于Neomi26/cc12m-images系列的一部分,该系列由122个仓库组成,从cc12m-images-000至cc12m-images-121,并由全局索引Neomi26/cc12m-images-index统一管理,确保了数据的高度组织性和可追溯性。
特点
该数据集的核心特点在于其便捷的浏览器可访问性和结构化的元数据支持。所有图像以标准JPEG格式独立存储,消除了对特定加载库的依赖,使得研究人员和开发者能够直接通过URL轻松获取和使用图像。清单文件提供了丰富的元数据字段,包括原始来源URL和文本描述,为多模态学习任务如图像-文本匹配和视觉问答提供了坚实基础。此外,作为大规模CC12M数据集的一部分,该子集保持了数据多样性和代表性,适用于需要大规模图像数据的各类计算机视觉应用。
使用方法
使用cc12m-images-010数据集时,用户可直接通过图像URL模式访问具体图片,例如`https://huggingface.co/datasets/Neomi26/cc12m-images-010/resolve/main/{folder}/{key}.jpg`。为高效管理数据,建议加载manifest.parquet文件,该文件提供了所有图像的元数据,包括密钥、URL及文本描述等。用户可基于这些信息筛选所需图像,并通过编程方式批量下载或在线引用。若需访问更多数据,可扩展至同一系列的其他仓库,或使用全局索引进行统一检索,特别适合用于图像描述生成、多模态预训练等研究任务。
背景与挑战
背景概述
cc12m-images-010是CC12M数据集的一个子集,该数据集由Pixparse团队于2021年创建,旨在服务于图像到文本的跨模态学习任务,如视觉语言模型的预训练。作为大规模网络爬取图像-文本对的代表性资源,CC12M涵盖约1200万对弱对齐数据,在计算机视觉与自然语言处理的交叉领域产生了深远影响,推动了CLIP、BLIP等模型的发展。此子集将原始WebDataset格式的图片重新托管为独立的JPEG文件,包含90,000张图像,并提供了每张图像的URL、原始来源、文本描述及尺寸信息,便于浏览器直接访问和学术研究。
当前挑战
CC12M所解决的领域挑战在于大规模视觉语言预训练数据集的匮乏,尤其是弱监督数据中的噪声与对齐质量问题。原始数据从网页抓取,存在描述不准确、图像模糊或语义无关的配对,影响模型学习效果。构建过程中,cc12m-images-010面临的挑战包括:将分布式存储的WebDataset解包为个体JPEG文件时需保证图像完整性;维护122个仓库的索引一致性,避免URL失效与数据冗余;以及原数据版权归属的伦理问题,需在发布时附上来源URL以遵循合规要求。
常用场景
经典使用场景
CC12M作为一个大规模图文对数据集,经典使用场景在于预训练视觉语言模型。该数据集包含约1200万张图片及其对应的自然语言描述,为模型学习跨模态对齐提供了丰富的训练素材。研究人员通常利用其海量的图文配对数据,对像CLIP、ALIGN这样的双塔模型进行对比学习训练,从而让模型掌握将视觉信息与文本语义关联的能力。此外,该数据集也常被用作图像描述生成任务的训练语料,或是验证视觉问答、文本到图像检索等下游任务效果的基准数据源。
衍生相关工作
CC12M的出现孵化了一系列经典研究。最广为人知的是OpenAI推出的CLIP模型,其训练数据虽未公开,但后续许多复现工作明确使用了CC12M作为替代数据源。基于CC12M的改进版本如CC3M也衍生出了多个变体,用于探索数据规模与模型性能的关系。在开源社区中,像OpenCLIP这类项目则直接以CC12M为基础进行训练,并开源模型权重;此外,许多针对数据噪声清洗、长尾分布处理的方法研究也以CC12M为实验平台,推动了数据驱动型视觉语言建模的发展。
数据集最近研究
最新研究方向
cc12m-images-010作为CC12M数据集的高质量子集,其90,000张图片与对应文本描述的配对形式,成为多模态预训练与图像-文本对齐研究的前沿资源。当前该领域的热点集中于利用此类大规模图文数据优化视觉-语言模型(如CLIP、BLIP等)的跨模态表征能力,尤其关注数据规模、质量与模型泛化性的平衡。cc12m-images-010的独立JPEG存储与结构化清单设计,为细粒度图像检索、弱监督学习以及去偏数据构建提供了可复用的实验基准,推动了对互联网噪声数据的清洗与组织策略的探索。其系列化发布模式(122个子集)也反映了社区对大规模分布式数据生态建设的重视,为研究数据冗余对模型鲁棒性的影响以及高效索引方法开辟了新路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务