遇见数据集

Neomi26/cc12m-images-019

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

cc12m-images-019是CC12M数据集的一个子集,包含90,000张图像,这些图像被重新托管为单独的JPEG文件,以支持浏览器直接访问。数据集提供了图像URL模式(例如https://huggingface.co/datasets/Neomi26/cc12m-images-019/resolve/main/{folder}/{key}.jpg),并包含一个清单文件(manifest.parquet),其中列有key、image_url、source_url、caption、width、height、original_width、original_height、shard、repo和path等信息。该数据集是Neomi26/cc12m-images-NNN系列的一部分(总计约131个仓库),原始数据集为pixparse/cc12m-wds。

cc12m-images-019是CC12M数据集的一个子集,包含90000张图像。该数据集将图像重新托管为独立的JPEG(Joint Photographic Experts Group)文件,以支持浏览器直接访问。数据集提供了图像URL模式(示例:https://huggingface.co/datasets/Neomi26/cc12m-images-019/resolve/main/{folder}/{key}.jpg),并附带一份清单文件manifest.parquet,该文件包含key、image_url、source_url、caption、width、height、original_width、original_height、shard、repo及path等字段信息。本数据集隶属于Neomi26/cc12m-images-NNN系列(该系列总计约131个仓库),其原始数据集为pixparse/cc12m-wds。

提供机构:
Neomi26
搜集汇总
数据集介绍
Neomi26/cc12m-images-019 数据集图片
构建方式
cc12m-images-019数据集源自广为人知的CC12M大规模图像-文本配对数据集,旨在为浏览器环境提供便捷的图像访问。该数据集将原始CC12M数据中的图像重新托管为独立的JPEG文件,共包含90,000张图像。每张图像通过统一的URL模式进行访问,并附有一份清单文件manifest.parquet,其中详细记录了图像的键值、来源URL、原始描述文本、尺寸信息以及分片和存储仓库路径,确保了数据的可追溯性和易用性。
特点
该数据集的最大特色在于其高度的结构化和可访问性。所有图像被整理成独立的JPEG文件,便于直接通过浏览器进行查看和下载,无需处理复杂的WebDataset格式。图像与文本描述一一对应,为图像描述生成、视觉问答等任务提供了对齐良好的多模态样本。此外,该数据集属于一个由约131个仓库组成的系列,配有全局索引,使得大规模检索和组合使用成为可能。
使用方法
使用时,可直接通过提供的图像URL格式拼接出具体图像的访问地址:https://huggingface.co/datasets/Neomi26/cc12m-images-019/resolve/main/{文件夹}/{键值}.jpg。同时,清单文件manifest.parquet提供了所有图像的元数据,用户可将其加载为DataFrame,方便进行数据筛选和分析。对于需要更大规模数据的场景,可结合Neomi26/cc12m-images-index全局索引,高效定位并获取其他仓库中的图像数据。
背景与挑战
背景概述
cc12m-images-019数据集是Conceptual 12M(CC12M)大规模图文数据集的一个子集,由研究团队Neomi26于近年创建并托管于HuggingFace平台。CC12M最初由Google研究人员提出,旨在为多模态视觉-语言模型提供高质量的图文对训练数据,其核心研究问题在于如何从互联网抓取的大规模噪声数据中筛选出语义对齐的图像与文本描述。该数据集通过重新托管CC12M中的图像为JPEG文件,极大便利了浏览器的直接访问与下游任务中的快速加载,对多模态表示学习、跨模态检索及图像描述生成等领域产生了重要推动作用。作为包含约9万张图像的子集,它构成了cc12m-images-NNN系列中一百三十余个存储库的重要一环,为大规模分布式训练提供了灵活的数据切分方案。
当前挑战
该数据集所面临的领域挑战主要源于多模态模型对高质量、大规模图文对数据的迫切需求,而互联网数据天然包含语义噪声、文本不完整或图像与描述匹配度低等问题,影响了模型学习的泛化能力与准确性。在构建过程中,挑战集中于从原始CC12M数据中高效提取并重新存储图像,需确保JPEG格式转换后不丢失关键视觉信息,同时维护一份包含原始URL、图像尺寸及描述等元信息的清单,以支持数据溯源与完整性验证。此外,将约9万张图像分布式存储于多个仓库并建立全局索引,增加了数据一致性与访问管理的复杂性,对大规模数据集的工程实现提出了严格要求。
常用场景
经典使用场景
在视觉与语言多模态研究领域,cc12m-images-019作为Conceptual 12M(CC12M)数据集的重要子集,为图文匹配与图像描述生成任务提供了高质量的标准化图像资源。该子集精心筛选了九万张JPEG格式图像,每张均附带原始描述文本,便于研究者直接用于训练和评估跨模态对齐模型。其经典使用场景涵盖从零样本图像检索到视觉问答系统的开发,尤其适用于需要大规模配对数据的对比学习框架,如CLIP等模型的预训练与微调。
衍生相关工作
cc12m-images-019的发布催生了一系列围绕图文数据清洗与预训练范式的衍生研究。经典工作包括基于CLIP的对比学习改进方法,如通过数据增强和难例挖掘提升配对质量;同时出现了利用该子集进行模态缺失场景下的图文生成研究,以及将图像-文本表征迁移至视频理解领域的尝试。该子集的索引体系还支持了跨数据集的组合检索,为动态知识图谱构建和多任务联合训练提供了可复用的数据基础设施。
数据集最近研究
最新研究方向
作为CC12M大规模图文数据集的分片子集,cc12m-images-019通过JPEG格式图片的独立托管与结构化元数据清单(manifest.parquet)的提供,显著降低了视觉语言模型预训练中数据加载的访问门槛。该系列数据集在跨模态对齐、零样本分类与图像描述生成等前沿方向上持续发挥关键作用,尤其是在CLIP系列模型的缩放法则探索和对比学习优化中,其规模可扩展的图文对质量已被广泛验证。随着多模态大语言模型对高质量合成数据需求的激增,此类细粒度、可追溯来源的数据分片不仅支持了千万级图文对的高效检索与过滤,还推动了从图像-文本语义一致性检测到弱监督目标检测等子课题的迭代。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务