遇见数据集

Dress-ED

收藏
github2026-07-01 更新2026-07-14 收录
数据链接:
官方服务:

资源简介:

Dress-ED(Dress Editing Dataset)是首个统一虚拟试穿、虚拟脱下和文本引导服装编辑的大规模基准数据集。每个样本包含店内服装图像、对应人物图像、编辑后的对应图像以及描述修改的自然语言指令。数据集涵盖三个服装类别、七种编辑类型和146,460个经过验证的四元组样本,支持可控、指令驱动的时尚生成模型的训练和评估。

Dress-ED (Dress Editing Dataset) is the first large-scale benchmark dataset that unifies virtual try-on, virtual try-off, and text-guided clothing editing. Each sample contains in-store clothing images, corresponding person images, edited corresponding images, and natural language instructions describing the modifications. The dataset covers three clothing categories, seven editing types, and 146,460 validated quadruple samples, supporting the training and evaluation of controllable, instruction-driven fashion generation models.

创建时间:
2026-06-27
原始信息汇总

数据集总览

Dress-ED(Dress Editing Dataset) 是首个统一虚拟换装(VTON)、虚拟脱装(VTOFF)与文本指导服装编辑的大规模基准数据集。数据集包含 146,460 个经过验证的四元组样本,覆盖 3 个服装类别7 种编辑类型,支持文本驱动的可控时尚图像生成模型的训练与评估。

核心亮点

  • 首个统一基准:在单一框架内整合虚拟换装、虚拟脱装与指令驱动编辑。
  • 大规模验证数据:146,460 个四元组样本,覆盖三个服装类别与七种编辑类型。
  • 丰富多样性:包含 49,664 种不同服装标识与 6,073 条独特编辑指令。
  • 全自动策展流水线:基于多模态大模型(MLLM)的属性提取 → 扩散模型合成 → 大语言模型(LLM)质量验证。
  • 四元组数据结构(I_garment, I_person, I_garment_edit, I_person_edit, T_inst),同时支持 VTON、VTOFF、服装编辑与人物编辑任务。
  • 真实图像逆编辑评估协议:确保指标计算基于真实地面真值图像,避免偏差。

数据集构成

每个样本为一个验证过的四元组:

字段 描述
I_garment 原始店内服装图像
I_person 穿着原始服装的人物图像
I_garment_edit 编辑后的店内服装图像
I_person_edit 穿着编辑后服装的人物图像(VTON 输出)
T_inst 自然语言编辑指令

编辑类型

编辑类型分为两大类:

  • 外观编辑:修改服装的视觉属性。
    • 改变颜色(Change Color)
    • 改变图案(Change Pattern)
    • 改变材质(Change Material)
    • 细粒度编辑(Fine-Grained)
  • 结构编辑:改变服装的几何结构或组成。
    • 添加细节(Add Detail)
    • 移除元素(Remove Element)
    • 修改结构(Modify Structure)

数据集统计

按编辑类型:

编辑类型 样本数量 占比
添加细节 39,776 27%
改变图案 39,559 27%
改变颜色 29,983 20%
修改结构 15,670 11%
改变材质 14,091 10%
移除元素 5,305 4%
细粒度编辑 2,076 1%
总计 146,460 100%

按服装类别:

类别 样本数量
连衣裙 80,865
上装 45,567
下装 20,028

训练/测试划分:

划分 样本数量
训练集 132,201
测试集 14,259

所有图像标准化为 768 × 1024 分辨率。

基准测试任务

  1. 指令驱动虚拟换装(Instruction-Driven Virtual Try-On)
    • 配对设置:给定 (I_person, I_garment, T_inst),生成穿着按指令修改后服装的人物图像。
    • 非配对设置:给定 (I_person, I_garment, T_inst),其中 I_garment 为不同服装,生成穿着编辑后版本 I_garment 的人物图像。
  2. 指令驱动虚拟脱装(Instruction-Driven Virtual Try-Off)
    • 给定 (I_person, T_inst),生成与描述修改匹配的编辑后店内服装图像 I_garment_edit

评估指标

  • 视觉保真度:FID、KID、SSIM、LPIPS、DISTS
  • 编辑正确性:DINO-I(内容级与地面真值的相似度)

数据获取

数据集可在 HuggingFace 上获取:davidelobba/Dress-ED

许可协议

本数据集采用 Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NC 4.0) 许可,仅允许用于非商业研究目的,并需注明出处。

搜集汇总
数据集介绍
Dress-ED 数据集图片
构建方式
Dress-ED数据集基于Dress Code构建,通过全自动四阶段多模态流程生成。首先,利用Qwen3-VL从每一对服装与人像图像中提取结构化属性(如颜色、图案、材质、领型、袖长等),并基于规则模板合成自然语言编辑指令,覆盖外观与结构两类修改。其次,采用FLUX.2 Klein根据指令对店内服装图像进行编辑,生成约30万张候选编辑服装。再次,借助FitDiT模型将编辑后的服装渲染到人体图像上,得到对应的人像编辑结果。最后,经过两步质量过滤:先由GPT-5对三元组进行指令符合度、内容保留和真实感评分(0-100),再使用经约5000个GPT-5标注样本微调的InternVL-3.5验证器大规模筛选,分数低于80的样本被剔除,最终保留146,460个高质量验证四元组。
特点
Dress-ED是首个统一虚拟试穿、虚拟脱衣和文本引导服装编辑的大规模基准数据集,具有多项显著特点。其四元组结构(原始服装、原始人像、编辑服装、编辑人像、编辑指令)同时支持多种任务。数据集涵盖三个服装类别(连衣裙、上装、下装)和七种编辑类型(颜色、图案、材质、精细外观、添加细节、移除元素、修改结构),包含49,664个不同服装身份和6,073条独特编辑指令。借助逆编辑策略的真实图像评估协议,避免了生成图像与真实图像不对齐带来的偏差。所有图像均标准化为768×1024分辨率,按Dress Code协议划分训练集(132,201样本)和测试集(14,259样本),确保服装身份不重叠。
使用方法
使用Dress-ED时,可直接从HuggingFace数据集页面(davidelobba/Dress-ED)下载全部四元组样本。针对指令驱动的虚拟试穿任务,在配对设置下,模型需根据给定的人像图像、目标服装图像和编辑指令生成修改后的人像;在非配对设置下,目标服装可替换为不同服装。虚拟脱衣任务则要求模型仅根据人像和指令生成编辑后的服装图像。评估采用逆编辑策略:模型从编辑后的图像恢复原始图像,并与真实原始图像计算视觉保真度(FID、KID、SSIM、LPIPS、DISTS)和编辑正确性(DINO-I相似度)指标。数据集遵循CC BY-NC 4.0许可,仅限非商业研究用途。
背景与挑战
背景概述
Dress-ED(Dress Editing Dataset)是由意大利特伦托大学、摩德纳与雷焦艾米利亚大学、比萨大学及穆罕默德·本·扎耶德人工智能大学的研究人员于2026年联合创建的第一个大规模指令驱动的虚拟试穿与试脱统一基准数据集。该数据集的核心研究问题在于弥合虚拟试穿(VTON)、虚拟试脱(VTOFF)与基于自然语言文本引导的服装编辑之间的鸿沟,旨在实现可控制的、由指令驱动的时尚图像生成。通过构建包含146,460个经过验证的四元组样本(覆盖三类服装与七种编辑类型)的基准,Dress-ED为多模态时尚内容生成领域提供了标准化的训练与评估平台,其影响力体现在首次将以往孤立的任务整合至单一框架,并采用逆向编辑的真实图像评估协议,显著提升了研究的可比性与可靠性。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两大层面。在领域问题方面,核心挑战在于如何统一性地处理虚拟试穿、虚拟试脱与基于文本的服装编辑,现有方法通常针对单一任务设计,缺乏对指令引导下外观与结构双重修改(如颜色、图案、材质变化及细节添加、移除)的泛化能力。在构建过程中,挑战尤为突出:自动化流水线需要依赖多模态大模型(如Qwen3-VL)进行结构化属性提取与指令生成,并借助扩散模型(如FLUX.2 Klein)合成编辑图像,但合成结果常存在语义偏差或视觉失真,因此开发了GPT-5评分与微调InternVL-3.5验证的两阶段过滤机制,以确保最终146,460个四元组的高质量。此外,不同编辑类型(如“精细修改”仅占1%)的样本分布不均衡,也为模型训练带来了额外的困难。
常用场景
经典使用场景
Dress-ED作为首个统一虚拟试穿、虚拟脱卸与文本引导服装编辑的大规模基准数据集,其经典使用场景集中于指令驱动的可控服装生成任务。研究者利用其提供的14.6万组验证四元组——包含原始服装图、人物图、编辑后服装图、编辑后人物图及自然语言指令——可同时训练和评估从外观属性到结构形态的七类编辑操作。数据集内建的配对与非配对虚拟试穿设置,以及独特的反向编辑评估协议,确保模型在真实图像上度量生成质量,为可编辑时装生成领域提供了标准化的训练与评测平台。
衍生相关工作
Dress-ED的推出催生了系列衍生研究工作。基于其四元组结构,研究人员可针对性改进文本到图像扩散模型(如FLUX与Stable Diffusion)在细粒度属性控制上的能力,开发出能同时处理颜色、材质、结构等复合编辑的统一生成框架。其自动化流水线的设计思路——多模态大模型提取属性、扩散模型合成、高质量验证——被后续工作借鉴以构建更复杂的跨模态编辑数据集。此外,反向编辑评估协议已应用于多项最新虚拟试穿方法的评测中,成为该领域事实上的评估标准之一,推动了零样本编辑与语义可控生成方向的纵深发展。
数据集最近研究
最新研究方向
随着多模态大模型与扩散生成技术的深度融合,文本驱动的虚拟试穿与试脱任务正迈向更精准、更可控的智能编辑新纪元。Dress-ED作为首个统一指令引导的服装编辑基准,通过自动化多阶段流水线整合了14.6万已验证的四元组样本,覆盖颜色、图案、材质乃至结构修改等七类编辑操作。该数据集的核心创新在于采用逆编辑策略构建基于真实图像的评估协议,有效规避了生成图像评价中的偏差问题。依托Qwen3-VL进行属性抽取、FLUX.2 Klein生成编辑服装、FitDiT完成试穿渲染,并借助GPT-5与微调InternVL-3.5实现双重质量筛选,Dress-ED不仅为虚拟试妆领域树立了标准化评价体系,更揭示了文本指令与视觉生成之间对齐的可能性边界。其提出的paired与unpaired设置涵盖了真实场景下用户从语义描述到视觉呈现的典型需求,为下一代可控时尚生成模型的研究提供了坚实的数据基础与评测标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务