遇见数据集

AbstractPhil/diffusion-pretrain-set-ft1

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

diffusion-pretrain-set-ft1 是一个多源图像-文本预训练数据集,从十个上游来源(big_liminal、deepfashion、ffhq、flux_assorted_bulk、flux_assorted_bulk_2、imagenet_synthetic、imdb、mannequins_v7、mannequins_v10、synth_chars)通过统一的数据处理流程整合而成。该数据集专为扩散模型(如Stable Diffusion、ControlNet)的完整预训练或微调设计,旨在创建更强大的基线预训练数据,并为训练下一代视觉语言模型(VLM)提供图像合成基础。数据集包含结构化标注(JSON格式),提供两个并行标注列:caption_vlm_json(基于Qwen3.5-0.8B VLM从图像直接生成)和caption_animetimm_json(基于animetimm标签生成)。数据集经过多层过滤(包括年龄分类器和正则表达式),以移除不当内容,确保数据质量。数据规模在10万到100万之间,包含图像、条件图像、掩码及元数据,适用于多任务学习如文本到图像生成、控制网络训练等。

diffusion-pretrain-set-ft1 is a multi-source image-caption pretraining dataset assembled from ten upstream sources via a uniform ingest pipeline. Designed for a full pretrain or finetune pipeline for diffusion models like Stable Diffusion and ControlNet, it aims to create a more powerful baseline pretraining dataset and a foundation for synthesizing images to train the next generation of VLM models. The dataset features structured captions in JSON format, with two parallel caption columns: caption_vlm_json (generated directly from images using Qwen3.5-0.8B VLM) and caption_animetimm_json (generated from animetimm tags). It includes rigorous filtering (age classifier and regex) to remove inappropriate content. The size ranges between 100K and 1M samples, containing images, conditioning images, masks, and metadata, suitable for multi-task learning such as text-to-image generation and control network training.

提供机构:
AbstractPhil
搜集汇总
数据集介绍
AbstractPhil/diffusion-pretrain-set-ft1 数据集图片
构建方式
该数据集由十个上游来源通过统一的摄取管道构建而成,旨在为扩散模型的预训练或微调提供强大的基线。每个来源均以独立的配置形式暴露,并同时整合为完整的“full”配置,便于消融实验或完整训练。数据集的构建遵循严谨的过滤政策,包含三层机制:基于源字幕文本的正则表达式初级过滤、针对真实照片类来源的面部年龄分类器过滤,以及针对风格化来源的特定策略。所有通过审核的行被保留,被拒绝的行则记录在源仓库的审计日志中。
特点
数据集的核心特点在于其并行双字幕结构。每一行图像均包含两条独立的结构化字幕列:`caption_vlm_json` 由视觉语言模型 Qwen3.5-0.8B 直接对图像生成,输出贴近真实、幻觉低的 JSON 描述;`caption_animetimm_json` 则通过动漫标签模型提取 Danbooru 风格标签,再经文本模型转换为 JSON。这种设计使训练流程能够根据内容类型灵活选择或混合使用,尤其擅长处理风格化内容与真实照片的互补需求。此外,数据集还包含了 ControlNet 所需的配对条件图像与掩码,以及丰富的元数据字段。
使用方法
数据集可通过 HuggingFace `datasets` 库直接加载,支持按来源独立加载或加载完整全集。使用时需注意对字幕列中的哨兵值进行过滤,以跳过尚未完成字幕生成或解析失败的行。对于包含 `celeb_name_raw` 等审计专用字段的来源,训练代码必须严格剥离这些字段,不得作为训练信号。推荐使用联合训练策略,将图像与两种 JSON 字幕及纯英语提示共同训练,以构建更鲁棒的视觉语言模型。数据集的许可状态为研究专用,各来源的许可证条款需分别遵守。
背景与挑战
背景概述
在扩散模型预训练领域,数据集的规模与质量直接决定了生成模型的基础性能与泛化能力。由研究者AbstractPhil于近期构建的diffusion-pretrain-set-ft1数据集,融合了十个异构上游数据源,涵盖逼真肖像、时尚模特、三维人体模型、合成字符及自然场景等多种视觉域,旨在为稳定扩散模型提供更强大的预训练或微调基线。该数据集通过统一的摄取管道与精细的过滤策略(包括基于正则表达式的年龄检测与面部年龄分类器)进行构建,特别强调结构化多模态字幕的并行生成。其影响力在于弥合了不同视觉风格与标注形式之间的鸿沟,为后续视觉语言模型的高效蒸馏与跨域迁移奠定了数据基础。
当前挑战
该数据集所应对的领域核心挑战在于,如何在一个多源异构集合中实现有效的主题关联与语义一致性,以避免训练出的模型产生内容混淆或质量退化。具体而言,不同来源的图像在风格(真实感 vs 风格化)、内容(人物、动物、场景)及标注粒度上存在显著差异,若简单混洗或顺序训练将导致模型理解失真。构建过程中面临的挑战包括:对敏感内容的自动过滤(需平衡召回率与误杀率)、对风格化来源(如三维人体模型)的面部年龄分类器的不可用性、多模态字幕生成的低效与同步问题,以及如何在保证数据多样性的同时,防止模型因信息过载或标注冲突而损失生成保真度。
常用场景
经典使用场景
在生成式人工智能的浪潮中,扩散模型作为图像生成的基石技术,其预训练阶段的数据质量与多样性直接决定了模型表现的天花板。diffusion-pretrain-set-ft1正是为此而生,它汇聚了来自十种异构上游来源的结构化图文数据,专为扩散模型的完整预训练或微调流程而设计。研究者可借助其精心设计的完整配置或单一源配置,灵活开展模型初始阶段的训练,从而为后续更复杂的生成任务奠定坚实基础。该数据集内含丰富的JSON格式描述和双路标注(VLM直接标注和Booru标签链式标注),使得模型能够同时捕捉视觉与语义的细腻关联,极大提升了训练结果的鲁棒性与泛化能力。
实际应用
在实际的工业与学术落地中,diffusion-pretrain-set-ft1展现出广泛的应用潜力。它可以直接服务于Stable Diffusion系列模型的预训练与微调任务,帮助开发者打造在特定风格或主题上表现更佳的图像生成引擎。具体而言,其包含的ControlNet姿态、深度、边缘等条件控制图像为服装虚拟试穿、角色动画生成、室内布局设计等商业场景提供了精准的多模态控制信号。同时,数据集所配备的JSON格式结构化描述不仅支持文本生成图像任务,还为视觉语言模型(VLM)提供了一条训练通道——通过图像与JSON提示对的联合训练,能够催生出更善于解析复杂指令的下一代多模态理解模型,例如用于高效批处理图像标注或自动化创意辅助工作流。
衍生相关工作
基于该数据集结构化双路标注的独特设计,已有研究者和工程师沿着两个方向展开了衍生工作。一方面,利用其VLM直接生成的JSON标注作为监督信号,衍生出以弱LoRA融合为基础、但又突破其局限性的高效图像语义解析模型,旨在降低对强大且昂贵的语言模型(如Qwen 27B)的依赖。另一方面,通过整合该数据集中Booru标签链式标注的固定词汇表优势,衍生了针对动漫和概念艺术风格的可审计文本-图像对齐方法,为内容创作领域引入了更为可控和透明的训练范式。此外,该数据集的模块化源配置结构也启发了新一代数据组合策略的研究,即通过精心选择子数据集和设置强化学习辅助的关联性损失,来规避因数据混排导致的模型语义崩塌问题,推动扩散模型预训练流程向更加智能和自适应的方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务