TripVVT-10K
收藏资源简介:
TripVVT-10K是由南京大学等机构联合构建的首个大规模野外视频虚拟试穿三元组数据集,包含10,031个高分辨率(720×1280)视频样本,覆盖30种服装类别及复杂室外场景。该数据集通过自动化合成流程构建,原始视频经网络爬取后,采用Wan-Animate框架生成服装交换视频,并结合Nano Banana技术提取服装参考图像。其核心价值在于提供了视频级跨服装监督信号,解决了现有数据缺乏真实场景多样性的问题,主要应用于电子商务、数字人创建等领域的虚拟试穿技术研发。
TripVVT-10K is the first large-scale outdoor video virtual try-on triplet dataset jointly developed by Nanjing University and other institutions. It includes 10,031 high-resolution (720×1280) video samples spanning 30 clothing categories and complex outdoor scenarios. Constructed through an automated synthesis pipeline, this dataset first crawls raw videos from the web, then utilizes the Wan-Animate framework to generate clothing-swapped videos, and leverages the Nano Banana technology to extract clothing reference images. Its core contribution is providing video-level cross-clothing supervision signals, which solves the problem that existing datasets lack diversity in real-world scenarios. This dataset is primarily applied to the research and development of virtual try-on technologies in fields such as e-commerce and digital human creation.
数据集概述:TripVVT-10K
数据集名称:TripVVT-10K
数据集地址:https://shaodingbao.github.io/TripVVT/
核心描述:
TripVVT-10K 是当前规模最大、多样性最丰富的真实场景(in-the-wild)三元组数据集,专门用于视频虚拟试穿(Video Virtual Try-On)任务。该数据集提供了明确的视频级跨服装监督信号,弥补了现有视频数据集在这方面的缺失。
数据集构成:
- 每个三元组包含:原始视频(Original Video)、服装参考图(Garment Reference)、试穿视频(Try-on Video)。
- 数据通过合成管道生成:从真实世界源视频出发,先生成服装交换的锚点帧,再结合姿态序列,通过蒙版修复生成“原始”版本;同时通过图像到服装合成生成标准商品图;原始源视频作为真值试穿目标。
- 管道确保了生成三元组的时空一致性。
数据预览:
数据集中包含多种服装类型示例,如:
- 上身服装(upper body):例如雨夜城市步道上的女性,身着黑色高开叉中裙;阳光露台场景中的女性,身着黑色修身服装。
- 连衣裙(dresses):夜晚城市环境中,身着浅绿色缎面吊带裙的女性。
配套基准(TripVVT-Bench):
- 包含100个测试案例,覆盖多种服装、复杂环境及多人场景。
- 评价指标涵盖:视频质量、试穿保真度、背景一致性、时间连贯性。
与基线方法对比:
- TripVVT(基于扩散Transformer的框架)取代了脆弱的服装蒙版,采用简单稳定的人体蒙版先验,在真实世界运动、遮挡和杂乱场景中仍能保持可靠背景保留。
- 在视频质量和服装保真度上优于当前最优的学术和商业系统,且在真实环境视频上的泛化能力显著提升。

- 1TripVVT: A Large-Scale Triplet Dataset and a Coarse-Mask Baseline for In-the-Wild Video Virtual Try-On南京大学; 九天研究院·中国移动通信; 吉林大学; 字节跳动 · 2026年



