遇见数据集

zlab-princeton/i1-captions

收藏
Hugging Face2026-06-12 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于文本到图像模型训练的数据集,包含用于i1模型受控实验和最终训练的所有标题。数据集由12个精选图像子集组成(如fluxreason、gptedit、imagenet22k等),每个子集提供大量图像-标题对,标题通过视觉语言模型(如Qwen3-VL-30B-A3B)合成生成,包括长标题、短标题以及基于不同预处理图像的变体。这些标题用于支持文本到图像模型的训练和消融研究,例如评估不同VLMs作为合成标题生成器的效果、标题长度的影响以及图像预处理方法。数据集以Parquet格式存储,可通过Hugging Face的datasets库加载。

This dataset contains all captions used in the controlled experiments and final training of the i1 text-to-image model. It comprises 12 curated image subsets (e.g., fluxreason, gptedit, imagenet22k), each providing a large number of image-caption pairs. The captions are synthetically generated by vision-language models (e.g., Qwen3-VL-30B-A3B), including long captions, short captions, and variants based on differently preprocessed images. These captions are used to support text-to-image model training and ablation studies, such as evaluating different VLMs as synthetic captioners, the impact of caption length, and image preprocessing methods. The dataset is stored in Parquet format and can be loaded via the Hugging Face datasets library.

提供机构:
zlab-princeton
搜集汇总
数据集介绍
zlab-princeton/i1-captions 数据集图片
构建方式
i1-captions数据集由普林斯顿大学研究团队构建,旨在为文本到图像模型提供高质量的训练数据。该数据集整合了12个精心挑选的图像数据集,包括FLUX-Reason-6M、GPT-Edit-Simpler、ImageNet-22K、iNaturalist、MegaLith-10M等,覆盖了自然场景、合成图像、医学影像、文本渲染等多种视觉领域。针对每个子数据集,研究团队使用先进的视觉语言模型Qwen3-VL-30B-A3B生成合成标题,部分子集还提供了多组标题(caption1至caption5)以增强数据多样性。训练时,每个图像会随机抽取一个标题,从而提升模型的泛化能力。
特点
该数据集的核心特点在于其规模庞大且多样性丰富,总计包含超过1.5亿张图像及其对应的合成标题。每个子数据集都提供了结构化列,其中'caption1'至'caption5'为Qwen3-VL生成的详细标题,而部分子集还额外包含Qwen2-VL、Qwen2.5-VL等不同版本模型生成的标题,用于消融实验。此外,'short'列提供短标题以研究提示长度的影响,'no_center_crop'列则基于未裁剪图像生成标题,用于评估图像预处理的作用。这种多维度设计使数据集极具研究价值。
使用方法
用户可通过HuggingFace的datasets库便捷加载数据,例如使用`load_dataset(\"zlab-princeton/i1-captions\", \"fluxreason\", split=\"train\")`命令即可获取fluxreason子集的训练数据。每个子集均以parquet格式存储,支持高效读取。下载图像及匹配图像-标题对的详细指南可在研究团队的代码仓库中找到。建议用户根据研究目标选择合适的子集和标题列,例如进行消融实验时可利用不同的VLM生成列。
背景与挑战
背景概述
i1-captions数据集由普林斯顿大学Boya Zeng、Tianze Luo等研究人员于2026年创建,旨在解决文本到图像生成模型中合成标注质量与数据多样性的核心问题。该数据集汇集了12个经过精心挑选的公共图像资源,包括ImageNet-22K、Places365、RedCaps等,覆盖了自然场景、物体、文本、生物分类及用户生成内容等多种视觉领域。研究团队利用Qwen3-VL-30B-A3B多模态大模型为每张图像生成了多达五组的长描述性字幕,并引入了多种消融设置(如短字幕、无中心裁剪等多版本),以系统探究合成字幕生成策略对模型性能的影响。i1-captions的发布为构建高性能、完全开源的文本到图像生成模型提供了标准化的训练数据,推动了该领域从封闭商业方案向透明可复现研究范式的转变。
当前挑战
该数据集面临的主要挑战包括:首先,在领域问题层面,文本到图像生成模型长期受限于训练数据中字幕与图像的对齐质量,低质量或过于简短的标注导致模型难以准确捕捉精细的视觉语义和长尾概念,i1-captions通过多视角合成字幕和多样化数据源尝试弥合这一鸿沟,但仍需应对合成字幕可能引入的偏差或幻觉。其次,在数据构建过程中,团队面临显著的工程挑战,如从97M样本的YFCC100M等大规模数据集中过滤噪声并保证分布均衡,同时为每个子集生成五份独立合成字幕的高昂计算资源消耗,此外,不同来源图像的分辨率、裁剪风格和标注格式的异构性增加了统一预处理与对齐的复杂性。
常用场景
经典使用场景
i1-captions数据集是一份专为文本到图像生成任务精心设计的标注集合,汇聚了来自12个不同视觉来源的高质量图像及其合成描述。作为i1模型训练的核心数据基石,该数据集最经典的使用场景在于为文本到图像生成模型提供规模庞大、标注丰富的图文对。研究者可凭借其精细的合成描述,训练模型理解图像与文字之间的映射关系,提升生成图像对文本指令的遵循能力。该数据集尤其适用于检测模型在复杂语义、对象交互及多元素构图场景下的表现,为评估现代扩散模型在多样化视觉内容上的生成质量提供了标准化数据基础。
解决学术问题
在学术研究中,i1-captions数据集有效回应了文本到图像生成领域长期存在的标注稀缺与描述质量失衡问题。传统数据集常受限于描述简短、语义模糊或仅包含类别标签,难以支撑对生成模型细粒度语义理解能力的深入探究。该数据集提供的多版本合成描述,允许研究者系统分析描述长度、视觉语言模型选取以及图像裁剪策略对生成效果的影响。通过控制单一变量进行消融实验,学术界得以量化不同描述质量在提升模型忠实度与可控性方面的实际贡献,从而推动对图文生成任务底层机制的更清晰认知。
衍生相关工作
i1-captions数据集的推出,催生了一系列关于合成描述对文本到图像生成模型影响的研究工作。其中最为核心的衍生工作当属i1模型本身,它通过系统化的控制实验,揭示了描述长度、标注质量及视觉语言模型选择对生成效果的关键作用。此外,该数据集还助力其他研究者探索更高效的描述生成流水线,为小规模视觉语言模型替代大规模闭源描述器提供实验依据。围绕数据集中不同裁剪策略和多重描述版本的消融研究,也激发了关于图像预处理与标注一致性如何影响模型训练的深入讨论,推动了更开放、更可复现的研究范式在图文生成领域的落地。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务