遇见数据集

VTEdit-Bench

收藏
github2026-06-22 更新2026-06-24 收录
官方服务:

资源简介:

VTEdit-Bench是一个综合基准,用于在现实虚拟试穿场景中评估通用多参考图像编辑模型。它包含24,220个测试图像对、5个代表性VTON任务、13,521个人源和10,926个服装源,覆盖了从标准虚拟试穿到多视角试穿、多人物试穿、模型间转移和多物品服装组合等逐步更具挑战性的设置。

VTEdit-Bench is a comprehensive benchmark for evaluating general-purpose multi-reference image editing models in real-world virtual try-on scenarios. It contains 24,220 test image pairs, 5 representative VTON tasks, 13,521 human source samples and 10,926 clothing source samples, covering progressively more challenging settings ranging from standard virtual try-on to multi-view try-on, multi-person try-on, cross-model transfer and multi-item clothing combination.

创建时间:
2026-06-21
原始信息汇总

数据集概述

VTEdit-Bench 是一个用于评估通用多参考图像编辑模型在现实虚拟试穿场景中表现的综合基准。该数据集由 Beihang University 和 Zhongguancun Academy 的研究团队创建,已被 ECCV 2026 接收。

核心组成

  • 总测试图片对数量:24,220
  • 覆盖任务:5 类代表性虚拟试穿任务
  • 人类图像来源:13,521 个
  • 服装图像来源:10,926 个
  • 辅助条件:为专用 VTON 模型提供,如人体关键点、人体解析图、DensePose、agnostic mask 等
  • 评估方式:结合 FID/KID 分布级评估与 VTEdit-QA 参考感知语义评估

任务与挑战

任务 描述 主要挑战
Shop2Model 将商店服装转移到目标模特图像 标准虚拟试穿
Shop2MultiView 将商店服装转移到不同视角的模特图像 视角鲁棒性
Shop2MultiModel 将商店服装转移到多人场景 多主体一致性
Model2Model 将一件衣服从一个人图像转移到另一个人图像 服装提取与身份保持
MultiShop2Model 将多件商店物品组合到一个人物上 多物品绑定与全局一致性

数据来源与构成

数据集构建自多个公开的 VTON/时尚数据集,并辅以网络收集数据。

任务 测试对数量 人类来源 服装来源
Shop2Model 9,521 DressCode, VITON-HD, StreetVTON DressCode, VITON-HD
Shop2MultiView 2,000 DeepFashion + web supplement DressCode
Shop2MultiModel 2,000 DeepFashion + web supplement DressCode
Model2Model 8,299 VITON-HD, StreetVTON VITON-HD, StreetVTON
MultiShop2Model 2,400 DressCode-MR DressCode-MR

数据集原始来源包括:

数据包结构

数据通过 Google Drive 发布,组织方式为每个数据源一个子文件夹,根目录包含五个任务的配对列表文件。数据包布局如下:

VTEdit-bench/ ├── shop2model_pairs.txt ├── shop2multiview_pairs.txt ├── shop2multimodel_pairs.txt ├── model2model_pairs.txt ├── multishop2model_pairs.txt │ ├── Dresscode/ # DressCode (shop + indoor model images) ├── VITONHD/ # VITON-HD (high-resolution model + garment images) ├── streetvton/ # StreetVTON (outdoor in-the-wild model images) ├── multi_view/ # DeepFashion multi-view sources + DressCode garments ├── multi_human/ # DeepFashion multi-person sources + DressCode garments ├── dresscodeMR/ # DressCode-MR (multi-reference outfit try-on)

每个配对列表文件指定了如何从子文件夹中读取测试对。对于大多数任务,每行包含两个以空格分隔的路径(服装路径在前,模特路径在后);对于 MultiShop2Model,每行列出所有参考服装路径,然后是目标人物路径。

辅助条件

提供以下辅助条件用于公平比较:

  • OpenPose / DWPose(人体关键点)
  • Human Parse(语义人体解析图)
  • DensePose(稠密人体对应图)
  • Agnostic Mask(去除服装区域的二值掩码)
  • Human Agnostic(掩去目标服装区域的人物图像)
  • Cloth Mask(服装图像的二值掩码)

评估指标

  • FID / KID:衡量生成图像与真实模特图像分布之间的距离
  • Model Consistency:评估身份、体形和姿态的保持度
  • Cloth Consistency:评估服装颜色、纹理、类别和结构的保持度
  • Image Quality:评估真实感、伪影、变形和视觉合理性
  • VTEdit-QA Overall:综合得分,取模型一致性、服装一致性和图像质量的最小值

评估模型

通用多参考图像编辑模型:Qwen-Image-Edit-2511, Uniworld, Flux.2, Flux.2-klein, DreamOmni2, OmniGen2, UNO, DreamO

专用 VTON 模型:IDM-VTON, StableVITON, ITA-MDT, OOTD-Diffusion, CatVTON, Any2AnyTryon, FastFit

部分实验结果(FID/KID 与 VTEdit-QA)

在 FID/KID 评估中,Flux.2 在 Shop2MultiView、Shop2MultiModel 任务上取得最佳结果,并拥有最低的平均排名(2.2)。Qwen-Image-Edit-2511 在 Model2Model 任务上表现最佳。FastFit 在 MultiShop2Model 任务上取得最佳 FID/KID。

在 VTEdit-QA 总体评分中,Flux.2-klein 在 Shop2Model、Shop2MultiView 和 Shop2MultiModel 任务上取得最高分。Flux.2 在 Shop2MultiView 和 Shop2MultiModel 任务上表现突出。CatVTON 在 Model2Model 任务上得分最高,FastFit 在 MultiShop2Model 任务上得分最高。

搜集汇总
数据集介绍
VTEdit-Bench 数据集图片
构建方式
VTEdit-Bench从DressCode、VITON-HD、StreetVTON、DeepFashion及DressCode-MR等多个公开虚拟试穿数据集中精选样本,并辅以网络收集的补充数据,构建了涵盖五类代表性任务的评测基准。其数据组织方式为每个数据源设立独立子文件夹,在根目录下提供五个任务级别的配对列表文件,每行以空白符分隔服装与模特图像的相对路径,对于多件套任务则依次列出所有参考服装后再指定目标人物,简洁地定义了测试用例的加载逻辑。
特点
该基准集包含24,220个测试图像对、13,521个不同人物源和10,926件服装源,覆盖从标准购物图到模特的多视角、多人场景、跨人物迁移以及多件套搭配等渐进增强的复杂挑战。除原始图像外,还提供了OpenPose关键点、人体解析图、DensePose、消融掩码等一系列辅助条件,便于专业化模型公平对比。评测上融合了FID/KID分布度量与VTEdit-QA语义评估,综合衡量生成质量与属性保持。
使用方法
用户需首先从Google Drive下载VTEdit-Bench数据包,并根据原始数据集许可从官方来源同步获取DressCode、VITON-HD等基础数据。加载时,读取根目录下对应任务的配对列表文件,解析每行的图像路径,路径相对于数据包根目录。对于多件套任务,解析首个路径集合作为多件服装,最后一个路径作为目标人物。随后可使用提供的辅助条件作为附加输入,在统一度量下运行并测评模型在五个任务上的综合性能。
背景与挑战
背景概述
虚拟试穿技术作为服装电商与数字时尚领域的核心应用,近年来随着图像生成模型的飞速发展而迎来革新。然而,现有基准测试如VITON-HD、DressCode等主要聚焦于经典的商店到模特(Shop-to-Model)场景,难以评估模型在复杂真实世界环境下的鲁棒性。为此,由北京航空航天大学、中关村实验室及哈尔滨工业大学联合研究团队于2026年提出的VTEdit-Bench基准应运而生。该基准由Xiaoye Liang、Zhiyuan Qu等学者构建,发表于ECCV 2026,包含24,220对测试图像,覆盖五类代表性虚拟试穿任务,系统性地考验通用多参考图像编辑模型在视角变化、多人场景、跨模特迁移及多物品组合等挑战下的表现,为评估模型在真实应用中的泛化能力提供了权威框架。
当前挑战
VTEdit-Bench直面虚拟试穿领域的两大类挑战。第一,现有领域任务面临基础瓶颈:模型需在保持人物身份、体型和姿态一致性的同时,精准保留服装的颜色、纹理和结构,并确保生成的图像无伪影、变形且视觉真实。第二,基准构建过程中遭遇多重难题:从多个公开数据集(如DressCode、VITON-HD、StreetVTON)及网络补充数据中精心筛选图像,确保涵盖多视角、多人物及户外等复杂场景;同时统一提供OpenPose、DensePose、语义解析图等多样化辅助条件,以支持公平比较。这些努力旨在填补现有基准在评估模型鲁棒性上的空白,推动虚拟试穿技术向实用化迈进。
常用场景
经典使用场景
VTEdit-Bench为虚拟试穿领域中多参考图像编辑模型的评估提供了一个全面且标准化的基准平台。该数据集涵盖了五大代表性任务,包括经典的Shop2Model、挑战视角鲁棒性的Shop2MultiView、考验多主体一致性的Shop2MultiModel、聚焦衣物提取与身份保持的Model2Model,以及考察多件物品捆绑与全局连贯性的MultiShop2Model。研究人员可利用这些精心构建的测试对,系统性地评测模型在不同复杂程度场景下的生成质量与鲁棒性,从而推动通用图像编辑器在现实虚拟试穿中的应用与发展。
解决学术问题
VTEdit-Bench填补了现有虚拟试穿基准测试在复杂真实场景下评估能力不足的学术空白。传统VTON基准主要局限于规范的Shop2Model设定,难以衡量模型在视角变化、多人场景、衣物迁移和多物品组合等现实挑战下的表现。该数据集通过引入24220个测试对和多维度评估指标(FID/KID与VTEdit-QA),为学界提供了统一且多维度的评价体系,有效解决了此前因缺乏标准化复杂场景测试集而导致的模型性能对比困难、进步方向模糊等问题,对推动该领域研究的规范化和深入发展具有里程碑意义。
衍生相关工作
基于VTEdit-Bench,衍生出了一系列具有代表性的研究工作,推动了通用图像编辑模型与专用VTON模型的深度融合与性能提升。在通用模型方面,Qwen-Image-Edit-2511和Flux系列在该基准上的表现展现了多参考图像编辑的巨大潜力;在专用模型方面,FastFit凭借在MultiShop2Model任务上的优异结果证明了专注于特定优化方向的有效性。此外,该基准催生了新的评估策略研究,如VTEdit-QA这一语义感知的参考评估指标,以及跨任务能力分析方法的探索。这些工作不仅验证了VTEdit-Bench作为评测平台的有效性,更激发了后续研究者针对真实复杂场景下虚拟试穿技术的创新与突破。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务