遇见数据集

text-to-image-diffusiondb-2M

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

该数据集是 DiffusionDB 的一个子集,专为训练文本到图像生成模型而设计。它源自 Hugging Face 上的原始 DiffusionDB 数据集(poloclub/diffusiondb),通过 Hugging Face Jobs 构建,覆盖了原始数据的前 20 个 part_id(共 20000 张源图像,经筛选后保留)。数据集中包含图像和对应的文本提示(prompt),并经过严格的清洗和过滤:丢弃了缺失、空或过短(少于3个字符)的提示;丢弃了任意维度小于256像素的图像;移除了NSFW标记的行(图像NSFW分数≥0.5或提示NSFW分数≥0.5);去除了基于SHA256哈希的完全重复图像。数据集包含以下列:image、prompt、part_id、seed、step、cfg、sampler、width、height、image_nsfw、prompt_nsfw。原始DiffusionDB中的user_name和timestamp字段被有意排除。此外,根目录下还包含一个独立的metadata.parquet文件,包含所有行(两个划分)及一个split列。尽管仓库名称中包含“2M”,但实际只是原始2000个part中的一小部分,并非完整的约200万张图像集合。数据集采用CC0-1.0(公共领域)许可协议,衍生自Wang等人2022年的工作(arXiv:2210.14896)。

This dataset is a subset of DiffusionDB, specifically designed for training text-to-image generation models. It derives from the original DiffusionDB dataset (poloclub/diffusiondb) on Hugging Face, built via Hugging Face Jobs, covering the first 20 part_ids of the original data (20,000 source images, filtered down). The dataset includes images and corresponding text prompts, and has undergone rigorous cleaning and filtering: prompts that are missing, empty, or too short (fewer than 3 characters) are discarded; images with any dimension smaller than 256 pixels are discarded; rows with NSFW flags (image NSFW score >= 0.5 or prompt NSFW score >= 0.5) are removed; exact duplicate images based on SHA256 hash are removed. The dataset contains the following columns: image, prompt, part_id, seed, step, cfg, sampler, width, height, image_nsfw, prompt_nsfw. The user_name and timestamp fields from the original DiffusionDB are intentionally excluded. Additionally, a separate metadata.parquet file is included in the root directory, containing all rows (both splits) with a split column. Although the repository name includes 2M, it is actually only a small part of the original 2000 parts, not the full set of approximately 2 million images. The dataset is licensed under CC0-1.0 (public domain) and derived from the work of Wang et al. 2022 (arXiv:2210.14896).

创建时间:
2026-08-17
原始信息汇总

DiffusionDB 文本到图像子集

数据集简介

该数据集是一个经过清洗和安全过滤的图像-提示词配对数据集,旨在用于训练文本到图像(text-to-image)模型。数据源自 DiffusionDB,由 Hugging Face Jobs 直接从 poloclub/diffusiondb 构建而成。

规模说明

  • 覆盖 part_id 1-20,即过滤前包含 20,000 张源图像
  • 尽管仓库名称中含有“2M”,但实际仅为 DiffusionDB 2000 个分区中的一小部分,并非完整的约 200 万图像集合
  • 数据集规模分类为 10K 到 100K 之间

过滤处理

  • 删除缺失、空值或过短(少于 3 个字符)的提示词
  • 删除任一维度低于 256 像素的图像
  • 删除被标记为 NSFW 的行(image_nsfw >= 0.5prompt_nsfw >= 0.5
  • 删除完全重复的图像(通过 SHA256 哈希匹配)

数据列

包含以下字段:imagepromptpart_idseedstepcfgsamplerwidthheightimage_nsfwprompt_nsfw

原始 DiffusionDB 元数据中的 user_nametimestamp 字段已被有意排除。仓库根目录还提供独立的 metadata.parquet 文件,包含所有行、两个分割(split)以及 split 列。

来源与许可

  • 来源:派生自 poloclub/diffusiondb
  • 许可协议:CC0-1.0(公有领域)
  • 引用:Wang et al., 2022, arXiv:2210.14896
搜集汇总
数据集介绍
text-to-image-diffusiondb-2M 数据集图片
构建方式
本数据集源自大规模文本到图像生成研究领域广泛使用的DiffusionDB,经由系统性清洗与安全过滤流程构建而成。原始数据覆盖DiffusionDB的1至20部分,共计两万张源图像,在过滤后保留了高质量样本。构建过程严格剔除提示词缺失、空白或长度不足三字符的条目,排除任一维度低于256像素的图像,并依据NSFW评分阈值(图像或提示词评分≥0.5)移除不当内容,同时利用SHA256哈希算法去除完全重复的图像。最终数据集保留了图像、提示词、参数配置等核心字段,而用户信息与时间戳等元数据被有意省略,以确保数据整洁度与隐私合规性。
特点
该数据集的核心特点在于其经过严格筛选的高质量图像-文本对,专为文本到图像模型的训练而优化。尽管命名中带有“2M”,实际为DiffusionDB的精选子集,规模远小于完整集合,却提供了更纯净的训练数据。每个样本包含图像、提示词及生成参数(如种子、步数、CFG、采样器等),便于研究者进行条件生成实验与参数分析。数据集的CC0-1.0许可协议使其可自由使用,无版权顾虑,而同时提供metadata.parquet文件,支持用户灵活获取完整元数据。
使用方法
数据集可直接通过HuggingFace Datasets库加载,使用load_dataset("whosouravsharma/text-to-image-diffusiondb-2M")即可获取,适用于训练或微调文本到图像生成模型。用户可根据任务需求,利用提供的图像与提示词字段构建训练对,或利用参数列进行条件生成研究。此外,仓库根目录下的独立metadata.parquet文件包含所有行及分割标签,便于自定义数据划分与过滤。对于需要更大数据规模的研究者,可通过HuggingFace Jobs从完整DiffusionDB中扩展此流程,或参考其原始论文与文档获取更全面的数据版本。
背景与挑战
背景概述
文本到图像生成模型近年来取得了显著进展,其中扩散模型作为核心架构,其性能高度依赖于大规模、高质量的图像-文本配对数据。DiffusionDB(Wang等,2022,arXiv:2210.14896)是一个包含约200万张由Stable Diffusion生成的图像及其提示词的大型数据集,用于支持扩散模型的研究与训练。本数据集(text-to-image-diffusiondb-2M)作为DiffusionDB的一个子集,由Hugging Face Jobs团队构建,选取了前20个part(共20000张源图),经过清洗与安全过滤,旨在提供一个更小、更易于处理且适用于训练和评估文本到图像模型的数据集。其创建时间为2022年之后,主要研究人员或机构为Hugging Face相关团队,核心研究问题是如何在保证数据质量与安全性的前提下,高效利用大规模生成数据促进文本到图像模型的训练与评估。该子集在DiffusionDB基础上提供了更精简的版本,便于研究者快速实验,对相关领域的影响力在于降低了数据获取与预处理的门槛,推动了文本到图像生成技术的普及与复现。
当前挑战
本数据集构建中面临的挑战包括:1)领域问题:文本到图像生成模型需要海量多样且提示词准确的图像文本对,以学习复杂的语义对齐和视觉呈现;然而原始数据中常含有缺失、模糊或过短的提示词,以及低分辨率或重复的图像,这些均会影响模型训练效果。2)构建过程:原始DiffusionDB规模庞大(2000个part,约200万图像),需进行高效的采样与过滤;过滤过程涉及图像NSFW检测和提示词NSFW检测,确保数据安全性;同时需要去重(SHA256哈希匹配)以避免重复样本造成的偏差。此外,数据清洗需平衡保留信息丰富性与去除噪声,且源数据中的用户元数据被有意排除,以保护隐私。这些挑战使得构建一个高质量、干净且安全的数据子集成为一项复杂任务。
常用场景
经典使用场景
在文本到图像生成这一前沿研究领域中,text-to-image-diffusiondb-2M数据集作为经过精炼与安全过滤的图像-提示词配对资源,为训练和评估扩散模型提供了坚实的数据基础。其核心应用场景聚焦于条件生成模型的训练,特别是稳定扩散(Stable Diffusion)架构,研究者可借助该数据集探究文本描述与视觉内容之间的深层语义映射关系,从而优化生成图像的逼真度与语义一致性。此外,该数据集亦适用于图像风格迁移、提示词工程效果验证以及生成模型鲁棒性测试等任务,其简洁的字段设计(涵盖图像、提示词、采样参数等)极大便利了实验的复现与对比分析。
解决学术问题
该数据集的构建有效回应了文本到图像生成领域长期面临的数据质量参差不齐与伦理安全风险等关键障碍。通过系统性地剔除缺失或过短提示词、低分辨率图像以及NSFW标记样本,并利用SHA256哈希去除重复图像,研究所获得的洁净数据显著降低了模型训练中的噪声干扰与偏见放大效应。此举不仅提升了生成内容的安全性与多样性,也为后续研究提供了可重复、可比较的基准数据,推动了条件生成模型中文本-图像对齐机制、采样策略优化及生成质量评估等核心学术议题的深入探索,其公开可得的元数据亦促进了跨机构研究的协同发展。
衍生相关工作
作为DiffusionDB庞大资源库的精选子集,该数据集已成为诸多衍生研究的关键依托。围绕其构建的经典工作包括基于对比学习与跨模态注意力机制改进的文本条件生成模型,这些模型在图像编辑、超分辨率重建及多模态理解任务中展现了卓越性能。此外,利用该数据集的提示词分布特征,研究者探索了自动化提示词生成与风格描述规范化技术,催生了一系列提示词优化工具。数据集的开放性与纯净性还促进了关于扩散模型可解释性分析及生成图像隐私风险评估的研究,其衍生成果不仅丰富了学术文献,也为工业级文本到图像系统的迭代升级提供了理论支撑与实证依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务