遇见数据集

GPIC (Giant Permissive Image Corpus)

收藏
github2026-05-29 更新2026-05-31 收录
数据链接:
官方服务:

资源简介:

GPIC是一个用于视觉生成的大规模许可图像数据集,包含约28万亿像素的多样化互联网图像,这些图像由先进的视觉语言模型进行标注。该数据集包括1亿个训练样本、20万个验证样本和100万个测试样本,所有图像均获得研究和商业使用的许可,并经过安全过滤和去重处理,托管在Hugging Face平台上。

GPIC is a large-scale licensed image dataset for visual generation. It contains diverse internet images totaling approximately 28 trillion pixels, which are annotated by state-of-the-art vision-language models. This dataset includes 100 million training samples, 200,000 validation samples, and 1 million test samples. All images are licensed for both research and commercial use, have undergone security filtering and deduplication, and are hosted on the Hugging Face platform.

创建时间:
2026-05-29
原始信息汇总

数据集名称

GPIC (Giant Permissive Image Corpus):一个用于视觉生成的大规模许可图像数据集。

核心特点

  • 规模:包含约28万亿像素,共1.01亿个样本,其中训练集1亿个、验证集20万个、测试集100万个。
  • 许可:所有图像均采用许可授权,可用于研究和商业用途。
  • 质量:经过安全过滤、去重处理,并由先进的视觉-语言模型标注标题。
  • 存储:集中托管于Hugging Face,提供标准化的基准测试协议。

数据集结构

数据以tar归档文件形式组织,包含8,000个训练包、32个验证包和128个测试包。每个tar包内按顺序存储图像及其对应的元数据(JSON格式):

  • 图像格式:.jpg或.png
  • 元数据字段
    • retrieved_at:检索时间
    • license:许可证
    • license_url:许可证链接
    • attribution:署名信息
    • key:唯一标识符
    • img_width:图像宽度
    • img_height:图像高度
    • split:数据集划分(nano / lite / full)
    • caption_type:标题类型(tag / short / medium / long)
    • caption:标题内容

访问链接

  • 数据集:https://huggingface.co/datasets/stanford-vision-lab/giant-permissive-image-corpus
  • 官网:https://gpic.stanford.edu
  • 论文:https://arxiv.org/abs/2605.30341
  • 模型与基线代码:https://huggingface.co/stanford-vision-lab/gpic-baselines
  • 评估工具包:https://github.com/keshik6/gpic

基线模型

提供基于像素空间流匹配的参考基线,代码位于baselines/PixelGen/目录,支持训练、采样和评估流程。

引用信息

bibtex @misc{chandrasegaran2026gpic, title={GPIC: A Giant Permissive Image Corpus for Visual Generation}, author={Keshigeyan Chandrasegaran and Kyle Sargent and Suchir Agarwal and Michael Jang and Michael Poli and Juan Carlos Niebles and Justin Johnson and Jiajun Wu and Li Fei-Fei}, year={2026}, eprint={2605.30341}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2605.30341}, }

搜集汇总
数据集介绍
GPIC (Giant Permissive Image Corpus) 数据集图片
构建方式
GPIC(Giant Permissive Image Corpus)是一个面向视觉生成研究的大规模许可图像数据集,由斯坦福大学等机构联合构建。其构建流程始于从互联网广泛采集图像,并利用先进的视觉语言模型为每一幅图像生成描述性字幕。所有图像均经过许可筛选,确保其可用于研究与商业用途。数据集包含约280万亿像素,覆盖100万训练样本、20万验证样本与100万测试样本,经过安全性过滤与去重处理,最终以Tar归档文件形式组织并集中托管于Hugging Face平台。每个Tar文件内以交替序列存储图像及其对应的JSON格式元数据与字幕,保证了数据与描述的紧密关联与高效读取。
特点
GPIC数据集的核心特点在于其规模宏大、许可开放与结构规范。其像素总量高达约280万亿,提供了前所未有的大规模训练基础。所有图像均采用许可协议,允许商业与非商业使用,打破了常见数据集在版权与使用限制上的壁垒。数据集经过严格的安全审查与去重处理,确保了数据质量与多样性。此外,GPIC提供了区分细致的字幕类型(标签、短句、中等描述与长文描述),增强了数据在多种视觉语义理解任务中的泛化能力。其标准化的Tar文件组织方式与配套的评估工具包,为生成模型的公平比较与可重复研究奠定了坚实基础。
使用方法
使用GPIC数据集进行模型训练与评估需要遵循清晰的流程。首先,用户可通过Hugging Face平台下载按训练/验证/测试划分的Tar归档文件,并按提供的索引与JSON元数据解析图像与字幕。训练时,建议基于配套的PixelGen基线代码进行,通过运行预定义的Shell脚本(如sbatch_pretrain_gpic_full_jit.sh)启动训练。采样与评测环节则通过相应的采样脚本与包含GPIC评估工具包的benchmark脚本完成,用户需在脚本中指定模型检查点路径与参考数据文件。GPIC还提供了独立的评估工具包(gpic_eval),支持计算FID、CLIP Score等主流生成指标,确保评估过程标准化与结果的可复现性。
背景与挑战
背景概述
GPIC(Giant Permissive Image Corpus)由斯坦福大学视觉实验室领衔,联合密歇根大学与Salesforce Research等机构于2026年构建,旨在为大规模视觉生成模型研究提供开放、可复现的数据基石。该数据集囊括约28万亿像素的互联网图像,所有图片均获得商业与研究双重许可,并由前沿视觉语言模型生成详细描述文本,涵盖1亿训练样本、20万验证样本及100万测试样本。通过严格的安全过滤与去重处理,GPIC有效填补了现有数据集在许可合规性、规模稳定性与标准化评测方面的空白,成为推动像素空间流匹配等生成范式持续演进的核心资源。
当前挑战
在领域问题层面,视觉生成模型长期受困于数据版权模糊、规模局限与分布偏差,导致模型泛化能力与商业化落地受阻,亟需一个兼具许可透明性与海量多样性的标准语料。构建过程中,团队需应对从互联网海量图像中高效筛选合规内容的瓶颈,包括跨平台版权自动化判定、多语种安全内容过滤,以及亿级样本的去重与元数据对齐。此外,为支持公平的社区基准测试,还需设计统一的评测流程与采样策略,确保模型性能的可比性与复现性,这些环节共同构成了GPIC构建的核心技术挑战。
常用场景
经典使用场景
在视觉生成领域,GPIC(Giant Permissive Image Corpus)作为一个包含约280万亿像素的庞大数据集,为像素空间流匹配等生成模型提供了标准化的训练与评估基准。研究者可利用其精心划分的1亿训练样本、20万验证样本及100万测试样本,开展从文本到图像生成的系统性实验。数据集经过去重、安全过滤与许可审查,确保了训练过程的稳定性和可复现性,成为探究大规模视觉生成模型扩展法则与泛化能力的基石。
实际应用
在实际应用中,GPIC驱动的生成模型可无缝嵌入创意设计、广告生成与内容创作等产业场景。由于所有图像均支持商业使用,企业可直接基于该数据集训练的模型构建图像生成服务,无需额外获取授权。此外,其安全过滤机制降低了生成不当内容的风险,使得该数据集成为开发面向公众的视觉生成工具(如自动化海报设计、虚拟场景构建)的可靠起点。
衍生相关工作
GPIC的发布已催生一系列衍生工作,包括基于其基准的像素空间流匹配基线模型PixelGen的适配,以及围绕数据子集(如Nano、Lite、Full三档规模)的研究。此外,官方提供的评估工具包和Hugging Face上的模型库为后续比较研究奠定了标准化框架。这些工作共同推动了关于数据规模、标注质量与生成性能之间关联的深入探讨,为构建更高效、更可控的视觉生成系统铺平了道路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务