VTEdit-Bench
收藏资源简介:
VTEdit-Bench是一个综合基准,用于在现实虚拟试穿场景中评估通用多参考图像编辑模型。它包含24,220个测试图像对、5个代表性VTON任务、13,521个人源和10,926个服装源,覆盖了从标准虚拟试穿到多视角试穿、多人物试穿、模型间转移和多物品服装组合等逐步更具挑战性的设置。
VTEdit-Bench is a comprehensive benchmark for evaluating general-purpose multi-reference image editing models in real-world virtual try-on scenarios. It contains 24,220 test image pairs, 5 representative VTON tasks, 13,521 human source samples and 10,926 clothing source samples, covering progressively more challenging settings ranging from standard virtual try-on to multi-view try-on, multi-person try-on, cross-model transfer and multi-item clothing combination.
数据集概述
VTEdit-Bench 是一个用于评估通用多参考图像编辑模型在现实虚拟试穿场景中表现的综合基准。该数据集由 Beihang University 和 Zhongguancun Academy 的研究团队创建,已被 ECCV 2026 接收。
核心组成
- 总测试图片对数量:24,220
- 覆盖任务:5 类代表性虚拟试穿任务
- 人类图像来源:13,521 个
- 服装图像来源:10,926 个
- 辅助条件:为专用 VTON 模型提供,如人体关键点、人体解析图、DensePose、agnostic mask 等
- 评估方式:结合 FID/KID 分布级评估与 VTEdit-QA 参考感知语义评估
任务与挑战
| 任务 | 描述 | 主要挑战 |
|---|---|---|
| Shop2Model | 将商店服装转移到目标模特图像 | 标准虚拟试穿 |
| Shop2MultiView | 将商店服装转移到不同视角的模特图像 | 视角鲁棒性 |
| Shop2MultiModel | 将商店服装转移到多人场景 | 多主体一致性 |
| Model2Model | 将一件衣服从一个人图像转移到另一个人图像 | 服装提取与身份保持 |
| MultiShop2Model | 将多件商店物品组合到一个人物上 | 多物品绑定与全局一致性 |
数据来源与构成
数据集构建自多个公开的 VTON/时尚数据集,并辅以网络收集数据。
| 任务 | 测试对数量 | 人类来源 | 服装来源 |
|---|---|---|---|
| Shop2Model | 9,521 | DressCode, VITON-HD, StreetVTON | DressCode, VITON-HD |
| Shop2MultiView | 2,000 | DeepFashion + web supplement | DressCode |
| Shop2MultiModel | 2,000 | DeepFashion + web supplement | DressCode |
| Model2Model | 8,299 | VITON-HD, StreetVTON | VITON-HD, StreetVTON |
| MultiShop2Model | 2,400 | DressCode-MR | DressCode-MR |
数据集原始来源包括:
数据包结构
数据通过 Google Drive 发布,组织方式为每个数据源一个子文件夹,根目录包含五个任务的配对列表文件。数据包布局如下:
VTEdit-bench/ ├── shop2model_pairs.txt ├── shop2multiview_pairs.txt ├── shop2multimodel_pairs.txt ├── model2model_pairs.txt ├── multishop2model_pairs.txt │ ├── Dresscode/ # DressCode (shop + indoor model images) ├── VITONHD/ # VITON-HD (high-resolution model + garment images) ├── streetvton/ # StreetVTON (outdoor in-the-wild model images) ├── multi_view/ # DeepFashion multi-view sources + DressCode garments ├── multi_human/ # DeepFashion multi-person sources + DressCode garments ├── dresscodeMR/ # DressCode-MR (multi-reference outfit try-on)
每个配对列表文件指定了如何从子文件夹中读取测试对。对于大多数任务,每行包含两个以空格分隔的路径(服装路径在前,模特路径在后);对于 MultiShop2Model,每行列出所有参考服装路径,然后是目标人物路径。
辅助条件
提供以下辅助条件用于公平比较:
- OpenPose / DWPose(人体关键点)
- Human Parse(语义人体解析图)
- DensePose(稠密人体对应图)
- Agnostic Mask(去除服装区域的二值掩码)
- Human Agnostic(掩去目标服装区域的人物图像)
- Cloth Mask(服装图像的二值掩码)
评估指标
- FID / KID:衡量生成图像与真实模特图像分布之间的距离
- Model Consistency:评估身份、体形和姿态的保持度
- Cloth Consistency:评估服装颜色、纹理、类别和结构的保持度
- Image Quality:评估真实感、伪影、变形和视觉合理性
- VTEdit-QA Overall:综合得分,取模型一致性、服装一致性和图像质量的最小值
评估模型
通用多参考图像编辑模型:Qwen-Image-Edit-2511, Uniworld, Flux.2, Flux.2-klein, DreamOmni2, OmniGen2, UNO, DreamO
专用 VTON 模型:IDM-VTON, StableVITON, ITA-MDT, OOTD-Diffusion, CatVTON, Any2AnyTryon, FastFit
部分实验结果(FID/KID 与 VTEdit-QA)
在 FID/KID 评估中,Flux.2 在 Shop2MultiView、Shop2MultiModel 任务上取得最佳结果,并拥有最低的平均排名(2.2)。Qwen-Image-Edit-2511 在 Model2Model 任务上表现最佳。FastFit 在 MultiShop2Model 任务上取得最佳 FID/KID。
在 VTEdit-QA 总体评分中,Flux.2-klein 在 Shop2Model、Shop2MultiView 和 Shop2MultiModel 任务上取得最高分。Flux.2 在 Shop2MultiView 和 Shop2MultiModel 任务上表现突出。CatVTON 在 Model2Model 任务上得分最高,FastFit 在 MultiShop2Model 任务上得分最高。




