遇见数据集

qwen-deepfashion

收藏
Hugging Face2026-07-02 更新2026-07-03 收录
官方服务:

资源简介:

Qwen DeepFashion(真实+合成全身服装)数据集包含160,015张完全由AI生成的全身时尚图像,使用Qwen-Image模型和Qwen-Image-Lightning 4步LoRA生成。服装描述来源于两个来源:真实的DeepFashion描述集和合成的服装生成器。通过共享的提示增强策略(fashion-v1),将这些描述渲染为从头到脚的服装照片,同时多样化穿着者、背景、姿势和构图,并保留每个源描述的性别适宜服装。该数据集旨在作为全身时尚生成的广泛、平衡的预训练基础,补充其肖像导向的姊妹数据集。数据集包含图像、提示文本和多种元数据字段,如人口统计意图(种族、性别、年龄区间等)、图像尺寸和质量标记。数据组成显示女性主导(70.5%),种族分布经过平衡采样,背景以真实世界设置为主(82%),图像分辨率包括1024×1024、832×1216和1216×832三种比例。该数据集适用于生成图像模型的研究与开发,特别是全身/时尚生成任务,包括预训练和微调数据、数据增强、服装和姿势条件生成,以及研究合成时尚数据中的人口统计平衡。重要注意事项包括:所有图像均为合成生成,不描绘真实人物;人口统计列仅表示生成意图,非真实属性;使用前需进行年龄验证过滤;数据集设计上女性占主导地位。

The Qwen DeepFashion (real + synthetic full-body clothing) dataset contains 160,015 fully AI-generated full-body fashion images, generated using Qwen-Image and Qwen-Image-Lightning 4-step LoRA. Clothing descriptions are derived from two sources: the real DeepFashion description dataset and a synthetic clothing generator. Via a shared prompt augmentation strategy (fashion-v1), these descriptions are rendered into head-to-toe clothing photos, with diversified wearers, backgrounds, poses and compositions, while retaining gender-appropriate clothing for each source description. This dataset aims to serve as a comprehensive and balanced pre-training foundation for full-body fashion generation, complementing its portrait-oriented sibling dataset. The dataset includes images, prompt texts, and multiple metadata fields such as demographic intent (race, gender, age range, etc.), image dimensions and quality markers. The dataset composition shows a female-majority distribution (70.5%), with a balanced sampled racial distribution; backgrounds are predominantly real-world settings (82%), and the image resolutions include three aspect ratios: 1024×1024, 832×1216 and 1216×832. This dataset is applicable to research and development of generative image models, particularly full-body/fashion generation tasks, including pre-training and fine-tuning data, data augmentation, clothing and pose-conditioned generation, and research on demographic balance in synthetic fashion data. Important notes include: all images are synthetically generated and do not depict real individuals; demographic columns only represent generation intent rather than real attributes; age verification filtering is required before use; the dataset is intentionally female-majority in its composition.

创建时间:
2026-06-29
原始信息汇总

数据集概述

Qwen DeepFashion (Real + Synthetic Full-Body Outfits) 是一个包含 160,015 张 全身体验时尚图像的合成数据集,由 Qwen-ImageQwen-Image-Lightning 模型生成。数据集旨在为全身体验时尚生成任务提供广泛、平衡的预训练数据。

数据来源与构成

  • 图像: 全部为 AI 生成的合成图像,分辨率为 1024×1024 (35.3%)、832×1216 (33.4%)、1216×832 (31.2%)。
  • 提示词来源:
    • 真实 DeepFashion 描述 (约 12,015 条): 源自 AbstractPhil/diffusion-pretrain-set-ft1 数据集的 DeepFashion 文本描述(仅文本,不包含原始图像)。
    • 合成服装描述 (约 148,000 条): 由性别区分的组合服装生成器创建,用于平衡 DeepFashion 中某些服装类别(如连衣裙、正装)的不足。合成部分女性占多数(约 7:3),同时包含男性平行数据。

生成过程

  • 模型: Qwen-Image (~20B) + Qwen-Image-Lightning (4 步 LoRA)。
  • 推理参数: 4 步推理,true_cfg_scale=1.0,bf16 精度。
  • 提示增强策略 (policy_version = fashion-v1):
    • 保留源服装描述及其性别信息。
    • 丰富场景:约 18% 为工作室背景,约 82% 为真实世界场景。
    • 确保每张图像为全身、从头到脚的构图。
    • 注入多样化元素:姿势 (约 75%)、拍摄视角 (约 55%)、相机角度 (约 50%)、光照 (约 60%)。
    • 人口统计学平衡: 当源描述未指定种族时,从近似均匀分布中采样标签,并标注长尾标签 (is_tail)。
    • 年龄限制: 强制主题年龄为 25-35 岁成年,并去未成年化处理。
    • 质量分级: 约 90% 为高质量彩色摄影,约 10% 为故意低质量的“业余”风格 (is_amateur)。
    • 去重机制: 使用基于 MinHash/LSH 的 DiversityGuard 机制,阈值 0.82,防止提示词过度相似。

数据集结构

数据集中包含以下列:

列名 类型 说明
id string 稳定唯一键;deepfashion_ 前缀代表真实描述,fsyn_ 前缀代表合成数据
image Image 生成的 PNG 格式图像
image_width, image_height int32 图像像素尺寸
prompt string 增强后用于生成的提示词
source_prompt string 增强前的原始服装描述
race string 意图的种族/民族标签(生成意图,非验证属性)
race_injected bool 种族标签是否为采样获得 (true) 或源自源描述 (false)
is_tail bool 种族标签是否属于长尾类别
gender string 意图的性别:womanmanperson
age_band string 始终为 25-35
hair string 意图的发型属性(约 70% 行注入,其余为空)
eye, expression, makeup, jewelry string 设计上为空(仅限肖像字段,全身体验策略中未使用)
is_amateur bool 是否为“业余”风格 (约 10%)
seed int64 每行唯一的确定性种子
width_ratio string 832x1216
policy_version string 增强策略版本 (fashion-v1)

数据组成统计

  • 来源: 合成女性 101,000 (63.1%),合成男性 47,000 (29.4%),真实 DeepFashion 12,015 (7.5%)。
  • 意图性别: 女性 112,785 (70.5%),男性 47,018 (29.4%),无标签 212 (0.1%)。
  • 意图种族: 白种人 (14.9%) 最多,其余主要类别各约 8.0%,长尾类别各约 2.0%。99.9% 的标签为采样生成。
  • 背景: 现实场景 82.0%,工作室 17.9%。
  • 构图: 所有图像均为全身/从头到脚构图。
  • 质量: 业余级约 10.0%。
  • 合成服装类别 (148,000 行):
    • 女装:连衣裙 (20,259)、外套 (17,108)、针织 (14,032)、正装 (13,956) 等。
    • 男装:上衣 (8,805)、正装 (7,220)、下装 (7,022) 等。
  • 去重率: 精确重复提示词率 0.005%,归一化重复率 0.006%。
  • 图像饱和度: 无灰度或接近灰度的图像。

预期用途

主要用于全身体验时尚生成类生成式图像模型的研究与开发,包括预训练、微调、数据增强、服装和姿态条件生成,以及合成时尚数据中人口统计学平衡的研究。

限制与注意事项

  • 年龄 / 未成年人: 提示词虽已限制为成人,但未进行自动年龄验证。模型可能生成外貌偏年轻的图像。用户在使用前必须执行严格的年龄验证并移除任何可能描绘未成年人的样本
  • 标签 ≠ 真实: 人口统计学和属性列仅为生成意图,并非对生成图像的验证,不可用于训练或评估真实人物的分类器。
  • 背景 / 服装统计: 背景统计接近准确,服装类别统计仅对合成行可靠,真实 DeepFashion 描述为自由文本,不在此统计范围内。
  • 图像偏差: 数据集女性占主导 (约 7:3),合成行中存在约 10% 的刻意低质量图像,且可能含有合成痕迹。
  • 许可: 生成组件基于 Apache-2.0 许可。数据集本身标记为 apache-2.0,但用户应根据自身用途确认最终许可,尤其是商业用途时需注意 DeepFashion 原始条款。
搜集汇总
数据集介绍
qwen-deepfashion 数据集图片
构建方式
该数据集由Qwen-Image模型与Qwen-Image-Lightning四步LoRA模块协同生成,共计160,015张全身时尚图像。其描述文本源自两个渠道:一是来自真实DeepFashion数据集的标注文本(仅使用文本,未包含原始图像),二是经由组合式生成器生成的虚拟服饰描述,后者在服装类别上对DeepFashion中代表性不足的类别(如连衣裙、正装)进行了上采样。所有文本均经过fashion-v1提示增强策略的处理,该策略在保留性别适配服装的前提下,对背景、姿态、构图与光线进行多样化编排,并通过基于MinHash的DiversityGuard模块抑制近似重复,确保每张图片的生成文本具有独特性。
特点
数据集核心特征在于其精心设计的结构平衡与多样性。图像涵盖1024×1024、832×1216与1216×832三种主流分辨率。在人口统计维度上,通过提示注入实现了种族标签的近似均匀分布,并包含特意稀有的长尾类别,同时严格保留来源文本中的性别属性,构建了约7:3男女比例的服饰体系。背景设定中约82%为现实场景,18%为影棚风格,约10%的图像刻意采用业余摄影风格以增加结构多样性。此外,数据集的元数据详尽记录了生成意图中的种族、年龄、发饰等属性,为下游的偏见分析与风格研究提供了可靠基础。
使用方法
用户可通过Hugging Face的datasets库中的load_dataset('AbstractPhil/qwen-deepfashion', split='train')便捷加载图像与元数据。由于图像以标准Image特征存储,解码过程自动完成。数据集特别适用于全身人物图像生成模型的预训练与微调、服装与姿态条件生成任务,以及合成时尚数据中人口统计平衡性的实证研究。需注意的是,人口统计列反映的是生成意图而非验证后的真实属性,不可用于训练或评估实际人脸或服装识别分类器。强烈建议用户在使用前对可能呈现未成年外貌的样本执行年龄验证过滤,以符合伦理与法规要求。
背景与挑战
背景概述
在文本到图像生成领域,全尺寸人体服装图像的生成长期受限于真实数据集的规模与多样性。Qwen DeepFashion数据集于2026年6月发布,由AbstractEyes团队基于Qwen-Image系列模型(Qwen-Image与Qwen-Image-Lightning LoRA)创建,包含160,015张完全由AI生成的全身时尚图像。该数据集的核心研究问题在于:如何为扩散模型提供一个兼具广泛覆盖与人口统计学平衡的预训练基材,以弥补传统数据集(如DeepFashion)在服装类别与种族/性别多样性上的不足。其影响力体现在为全身服装生成任务提供了结构化的合成数据,同时保留了真实的服装描述,并通过多样化的人种、背景与姿态赋予了生成数据的广泛适用性。
当前挑战
该数据集所解决的领域挑战在于:传统时尚图像数据集通常以女性为主且类别偏斜,难以支撑性别均衡且类别多样的全身服装生成;Qwen DeepFashion通过合成服装生成器对DeepFashion未充分代表的类别(如礼服、正装、外套)进行加权,并构建了男性子集,缓解了这一问题。构建过程中面临的挑战包括:1) 如何在不使用原始DeepFashion图像的前提下,从其文本描述中提取服饰信息并生成高保真的全身图像;2) 如何通过提示策略实现人口统计学平衡,避免模型固有的外貌偏向,同时保留源描述中的性别属性;3) 如何确保生成的图像质量(仅10%为低质量业余风格)且去除近重复样本,最终将重复率控制在0.005%以下。
常用场景
经典使用场景
在生成式图像模型的研究与开发领域,Qwen-DeepFashion数据集最经典的用途在于支撑全身时装图像的生成任务。它通过提供超过十六万张由文本提示词驱动的全合成图像,涵盖了从连衣裙到外套、从运动装到正装的丰富服饰类别,并内嵌了多样化的穿着者种族、性别、年龄及拍摄背景等属性。该数据集常被用作预训练或微调基座,帮助模型学习从粗糙的服饰描述到精细的头到脚摄影构图之间的映射关系,尤其适用于条件生成场景,如按文字描述生成指定款式的全身穿搭照片。
解决学术问题
该数据集在学术层面有效回应了生成式模型研究中关于数据多样性与标注偏差的长期挑战。传统时装数据集如DeepFashion存在性别比例失衡、种族多样性不足以及服饰类别偏向等问题,而Qwen-DeepFashion通过引入性别均衡的合成服饰生成器与种族/族裔的公平采样策略,大幅缓解了这些结构性偏差。它支持研究者探究扩散模型在不同人口统计属性下的生成质量与一致性,并为评估生成图像中的隐含偏见提供了可量化的分析基准。从根本上说,它推动了关于合成数据在缓解真实数据分布不均方面效用的学术讨论。
衍生相关工作
围绕Qwen-DeepFashion数据集衍生的经典工作主要集中在三个方向。首先是基于扩散模型的全身时装生成架构优化,研究者受其启发发展了更高效的文本到图像对齐方法,例如通过引入服饰类别提示增强模块以提升细粒度生成准确性。其次是公平性与偏见缓解研究,该数据集作为基准平台催生了多种对抗性训练策略与属性重平衡损失函数,用以自动纠正模型对不同肤色、年龄群体的生成倾向。最后,利用数据集中的两套来源提示词(真实DeepFashion文案与合成生成器文案),衍生工作探索了跨域风格迁移与提示词增强对生成结果多样性的影响,形成了关于数据合成管线设计的新方法论体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务