遇见数据集

Neomi26/cc12m-images-013

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

这是一个CC12M数据集的子集,图像被重新托管为独立的JPEG文件,以便于浏览器访问。该数据集包含90,000张图像,图像URL遵循特定模式,并提供一个清单文件(manifest.parquet),其中包含图像的key、image_url、source_url、caption、width、height、original_width、original_height、shard、repo、path等元数据信息。它是Neomi26/cc12m-images-NNN系列的一部分,原始数据集为pixparse/cc12m-wds。

This is a subset of the CC12M dataset, where all images have been re-hosted as standalone JPEG files to facilitate browser access. This dataset contains 90,000 images, whose URLs follow a specific pattern. A manifest file (manifest.parquet) is provided, which includes metadata information such as image key, image_url, source_url, caption, width, height, original_width, original_height, shard, repo, and path. It is part of the Neomi26/cc12m-images-NNN series, with the original dataset being pixparse/cc12m-wds.

提供机构:
Neomi26
搜集汇总
数据集介绍
Neomi26/cc12m-images-013 数据集图片
构建方式
cc12m-images-013数据集源自广为人知的Conceptual 12M(CC12M)大规模图文对数据集,专为浏览器便捷访问而重构。该子集从原始CC12M数据中精选90,000张图像,将其重新托管为独立的JPEG文件。每张图像均通过统一URL模式(`https://huggingface.co/datasets/Neomi26/cc12m-images-013/resolve/main/{folder}/{key}.jpg`)提供直链访问,确保加载效率。同时,数据集附带了`manifest.parquet`清单文件,详尽记录每张图像的键值、图像URL、来源URL、文本描述、宽度、高度、原始尺寸、分片信息、所属仓库及路径等元数据,极大便利了用户的检索与使用。
特点
该数据集最显著的特点在于其组织架构的精细化与可扩展性。作为Neomi26/cc12m-images系列的一部分,它由122个独立仓库(编号从000至121)构成,cc12m-images-013仅为其中之一,全局索引通过Neomi26/cc12m-images-index统一管理。这种模块化设计使用户能够按需获取特定子集,而无需下载整个海量数据集。此外,所有图像以JPEG格式直接托管于HuggingFace平台,避免了原始数据集中URL失效或访问受限的问题,大幅提升了数据获取的稳定性与便利性。
使用方法
使用cc12m-images-013数据集时,用户可直接通过给定的图像URL模式批量获取JPEG文件,或利用`manifest.parquet`清单文件进行精准筛选。该清单支持基于图像尺寸、来源URL或文本描述等字段的复杂查询,适用于训练多模态模型(如图文检索、图像描述生成)的前期数据准备。用户还可通过访问全局索引仓库`Neomi26/cc12m-images-index`,探索其他121个子集的元数据,实现对整个CC12M图像数据库的灵活调用与组合。
背景与挑战
背景概述
cc12m-images-013 数据集是源自 Conceptual 12M (CC12M) 的一个子集,后者由谷歌研究团队于2021年提出,旨在为视觉与语言多模态模型提供大规模、高质量的图文对数据。该数据集的核心研究问题在于如何从海量网络图像中筛选出语义丰富且匹配准确的图文样本,以支撑图像描述、视觉问答等跨模态任务的模型预训练。CC12M 的出现填补了中小规模数据集与超大规模数据集(如 LAION-400M)之间的空白,成为领域内广泛采用的基准资源。cc12m-images-013 作为其分片之一,由 Neomi26 团队重新托管为可直接通过浏览器访问的独立 JPEG 文件,共包含90,000张图像,延续了原始数据集在图文匹配质量与数据可获取性上的优势,对推动多模态研究的可复现性具有重要意义。
当前挑战
该数据集所解决的领域问题在于,早期多模态模型常受限于图文对数据的噪声与不均衡问题,而 CC12M 通过自动化过滤与人工校验相结合的方式,显著提升了图文对应关系的准确性。然而,在构建过程中,面临的主要挑战包括:原始网络图像来源的多样性导致图像质量参差不齐,需耗费大量计算资源进行清洗与去重;此外,将大规模数据以分片形式重新托管时,需确保链接稳定与元数据完整,避免因原始 URL 失效造成的数据不可用。cc12m-images-013 通过本地化存储与压缩格式优化,缓解了带宽与存储压力,但仍需持续应对版权合规与数据版本控制等潜在问题。
常用场景
经典使用场景
CC12M作为大规模图文对数据集,其子集cc12m-images-013的经典使用场景在于为多模态预训练模型提供高质量的视觉-语言对齐数据。研究者常利用该数据集训练诸如CLIP、ALIGN等对比学习模型,通过在海量图文对中学习图像与文本的联合表征,从而提升模型在零样本分类、跨模态检索等任务上的泛化能力。该数据集的图片以JPEG格式单独托管,便于直接加载,降低了大规模多模态研究的工程门槛。
实际应用
在实际应用层面,基于cc12m-images-013等子集训练的多模态模型已广泛赋能诸多产品。例如,在电商领域,模型可用于商品图像的自动标签生成与跨模态搜索;在社交媒体中,支持以图搜文或图文联合的内容推荐;在无障碍技术中,帮助为视觉障碍用户生成图像的文字描述。此外,这些模型还常用于图像描述系统、视觉问答机器人等交互式AI应用的底层引擎。
衍生相关工作
cc12m-images-013衍生了一系列重要的研究工作。其中,OpenAI的CLIP模型率先验证了对比学习在CC12M规模数据上的有效性;后续工作如FILIP、DeCLIP等在此基础上提出了细粒度对比损失与自监督信号融合策略,进一步提升了表征质量。此外,社区还基于该数据集探索了数据高效微调、提示学习等范式,推动了多模态领域从预训练到下游任务适配的完整技术链条发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务