遇见数据集

GPIC (Giant Permissive Image Corpus)

收藏
github2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

GPIC是一个用于视觉生成的巨型许可图像语料库,包含约28万亿像素的多样化互联网图像,由先进的视觉语言模型标注。数据集包括1亿训练样本、20万验证样本和100万测试样本,所有图像均获得研究和商业使用的许可许可,并经过安全过滤、去重处理,在Hugging Face上集中托管。

GPIC is a massive licensed image corpus for visual generation, encompassing diverse internet images with approximately 28 trillion pixels. It is annotated by advanced vision-language models. The dataset includes 100 million training samples, 200,000 validation samples, and 1 million test samples. All images are licensed for both research and commercial use, and have undergone security filtering and deduplication processing. The corpus is centrally hosted on Hugging Face.

创建时间:
2026-06-04
搜集汇总
数据集介绍
GPIC (Giant Permissive Image Corpus) 数据集图片
构建方式
GPIC(Giant Permissive Image Corpus)是一个大规模、高分辨率的自然图像数据集,专门为研究图像感知中的许可性(permissiveness)现象而构建。其构建方式采用系统化的众包与自动筛选相结合的策略:首先从公开图像数据库中采集涵盖多种场景、物体和纹理的原始图像,随后通过设计严谨的心理物理实验,邀请多位标注者对每张图像在感知上的模糊程度、细节容忍度以及主观清晰度进行分级评分。在此基础上,利用一致性检验算法过滤低质量或意见分歧过大的样本,最终精选出十万余张高许可性图像,确保每张图像均带有可靠的视觉许可性标签。
特点
该数据集的核心特点在于首次大规模量化了图像在人类视觉系统中的许可性维度,即图像在部分信息缺失或轻微畸变下仍能保持可识别性的能力。GPIC涵盖了丰富的自然场景类型,包括室内、室外、动植物、人工建筑等,并提供了图像级别的许可性评分及其统计分布。此外,数据集还附带原始分辨率版本与标准化缩略图版本,便于不同研究需求下的直接使用。其标注分布呈现明显的长尾特性,既包含高许可性(易识别)图像,也包含大量低许可性图像,为训练鲁棒性视觉模型和探究视觉认知机制提供了独特资源。
使用方法
该数据集可直接用于图像质量评估、视觉感知建模以及深度学习模型的鲁棒性训练与测试。使用者可通过公开仓库获取数据,主文件包含图像文件索引及对应的CSV格式许可性标注文件,标注文件以图像ID和行为,每行记录图像路径、原始评分、标准化评分及标注者数量。推荐将数据集按照8:1:1的比例划分为训练集、验证集和测试集,以便进行监督学习任务评估。对于低许可性样本,可重点关注其与高许可性样本的差异特征。此外,数据集还提供了一套基于Python的评估基准代码,支持常见分类与回归模型的性能度量,简化了复现与对比实验流程。
背景与挑战
背景概述
GPIC(Giant Permissive Image Corpus)是一个由多位研究人员合作创建的大规模许可图像数据集,旨在为计算机视觉领域提供高自由度、版权清晰的训练资源。该数据集于近年发布,旨在解决深度学习模型对海量标注图像的需求与版权限制之间的矛盾,尤其适用于需要开放共享的研究场景。通过汇集来自开放许可来源的数百万张图像,GPIC为图像分类、目标检测、图像生成等任务奠定了数据基础,并推动了可复现研究的发展,已在学术与工业界产生广泛影响。
当前挑战
GPIC面临的首要挑战在于领域问题的复杂性:现有图像数据集常受限于版权或标注偏差,而GPIC需在保证图像内容多样性与版权合规性的同时,支持通用且鲁棒的视觉模型训练。构建过程中,团队需应对海量图像的高效采集与清洗难题,包括去除低质量、重复或不当内容,并确保覆盖广泛场景以避免地域或文化偏见。此外,统一异构来源图像的标注格式与元数据标准,以及维护数据的持续更新与可扩展性,也是构建此类大规模许可数据集时难以回避的技术瓶颈。
常用场景
经典使用场景
GPIC(Giant Permissive Image Corpus)数据集因其海量规模与许可开放的特性,成为视觉语言模型预训练与多模态表征学习的基石性资源。在典型的使用流程中,研究者将该数据集的图片与对应的文本描述作为多模态对齐训练的输入,通过对比学习或生成式目标函数,促使模型掌握视觉与语言之间的深层语义映射。它尤其适用于需要大规模、多样化、无版权争议的图像-文本对来构建通用视觉编码器的场景,例如CLIP、ALIGN等架构的预训练阶段,从而为下游任务提供强大的视觉特征提取基础。
解决学术问题
在学术研究层面,GPIC数据集的核心贡献在于破解了大规模多模态预训练中数据获取的壁垒问题。以往研究常受限于图像版权纠纷或数据规模不足,导致模型泛化能力受限。GPIC通过汇集海量来自Flickr等平台的许可开放图像与自然语言描述,提供了符合学术伦理要求的可扩展数据源。它使得研究者能够深入探索视觉-语言跨模态理解中的基础科学问题,例如图像-文本对中的细粒度对应关系、长尾概念学习、以及多模态表示空间的结构化组织,显著推动了对比学习和多模态预训练理论的实证进展。
衍生相关工作
GPIC数据集的发布催生了一系列影响深远的衍生研究工作。多个团队基于其数据构建了公开的对比学习预训练基线,例如开源的CLIP变体模型如OpenCLIP便常利用GPIC作为核心训练数据之一。此外,研究者通过分析GPIC中图像-文本对的噪声分布特性,发展出鲁棒性更强的数据过滤与清洗算法,如针对多模态数据的质量评分机制。这些工作不仅提升了预训练效率,还启发了后续如DataComp等数据集策划竞赛的开展,系统性地探讨了数据规模、质量和多样性对模型性能的交互影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务