遇见数据集

OmniView

收藏
arXiv2026-09-04 更新2026-09-05 收录
数据链接:
官方服务:

资源简介:

OmniView是一个大规模多视角试穿数据集,由研究团队构建,旨在解决现有数据集规模小、类别单一、服装不完整等问题。数据集包含6,110个样本,每个样本提供至少两个视角的人物图像,其中88%包含背面视图,并配有前后平面服装图像。覆盖上衣、下装、全身及外衣四大类别,并通过合成伪数据支持跨类别和分层试穿。数据收集自电商平台和开源数据集,经大语言模型标注、分组、合成伪数据及人工审核确保质量。该数据集主要用于视频虚拟试穿任务,能够提升模型在复杂视角和多样试穿场景下的生成鲁棒性与服装一致性。

OmniView is a large-scale multi-view virtual try-on dataset constructed by a research team, aiming to address the limitations of existing datasets such as small scale, limited category types and incomplete clothing coverage. The dataset consists of 6,110 samples, each providing human images from at least two viewpoints, with 88% of them including back views and paired with front and back flat-lay clothing images. It covers four major clothing categories: tops, bottoms, full-body outfits and outerwear, and supports cross-category and layered try-on via synthesized pseudo data. The data is collected from e-commerce platforms and open-source datasets, and its quality is ensured through LLM-based annotation, grouping, pseudo-data synthesis and manual review. This dataset is primarily used for video virtual try-on tasks, and it can enhance the model's generation robustness and clothing consistency under complex viewpoints and diverse try-on scenarios.

创建时间:
2026-09-04
原始信息汇总

数据集详情:BooM-VVT

BooM-VVT 是一个基于图像级伪数据的无掩码视频虚拟试穿(Mask-Free Video Virtual Try-On)框架。该页面展示了其核心方法、关键贡献及其配套的 OmniView 数据集。

核心任务与目标

该工作旨在解决视频虚拟试穿(VVT)中现有方法依赖掩码(mask)来定位试穿区域的问题。现有方法在处理大幅度运动或严重遮挡时表现脆弱,而构建视频级伪数据成本高昂。BooM-VVT 提出了一套无需掩码的框架,仅利用成本较低的图像级伪数据来学习试穿区域定位,并生成高保真、时间上连贯的试穿视频。

关键贡献

该工作提出了四项核心贡献,共同支撑其无掩码视频试穿能力:

  1. 多阶段训练策略 (Multi-Stage Training):该策略利用图像级伪数据进行无掩码试穿区域定位学习,显著减少了对昂贵视频级伪数据的依赖。
  2. 服装敏感关键帧采样 (Garment-Sensitive Keyframe Sampling):根据与服装相关的身体区域来选择关键帧,以更好地跨帧捕获和保留服装外观。
  3. 帧共享3D旋转位置编码 (Frame-Shared 3D-RoPE):在关键帧与目标帧之间建立时空对应关系,以实现更精确的服装细节迁移。
  4. OmniView 数据集:一个大规模多视角试穿数据集,包含 6,110 个样本,支持多样化的视角、服装类别和试穿任务。

OmniView 数据集详情

该数据集是 BooM-VVT 框架的组成部分,旨在支持多样化的试穿任务。

  • 规模: 包含 6,110 个样本。
  • 特点: 支持多视角(Multi-View)、跨类别(Cross-Category)和分层(Layered)试穿任务。
  • 用途: 用于支持模型在多样化场景下的试穿能力,如多视角试穿、跨品类试穿(例如不同服装类型间的替换)以及分层试穿(如穿搭多件衣物)。

方法论概览

该框架基于关键帧驱动的视频生成范式。其流程包括:

  1. 关键帧采样:应用服装敏感关键帧采样选择能最佳展示服装相关身体区域和互补视角的帧。
  2. 关键帧试穿:通过多帧试穿模型将选定的关键帧处理为一致的试穿图像,可选地以前视图和后视图的服装图像为条件。
  3. 视频生成:将关键帧结果作为外观令牌输入视频生成模型,利用姿态引导、位置和外观LoRA模块以及帧共享3D-RoPE,将服装细节迁移到整个视频,同时保持运动和背景。

其训练过程分为三个阶段:第一阶段使用带训练时掩码的成对人类视频学习关键帧驱动的视频生成;第二阶段用图像级伪对替代昂贵的视频级监督,迫使模型推断可编辑试穿区域;第三阶段合成并筛选小规模视频级伪样本,以微调无掩码模型,提升时间连贯性和视频质量。

BibTeX 引用信息

该页面提供了 BibTeX 格式的引用条目,具体如下:

bibtex @article{boomvvt2025, title = {BooM-VVT: Boosting Mask-Free Video Virtual Try-On with Image-Level Pseudo Data}, author = {Anonymous}, journal = {arXiv preprint arXiv:XXXX.XXXXX}, year = {2025} }

注:该页面为匿名双盲评审材料,作者和机构信息为匿名状态,论文链接指向本地文件。

搜集汇总
数据集介绍
OmniView 数据集图片
构建方式
在视频虚拟试穿研究领域,现有数据集如MVG在规模、服装类别多样性和完整性上存在不足,难以支撑复杂视角下的可靠试穿生成。为弥补这一空白,OmniView数据集应运而生,其构建流程严谨且具有针对性。首先,从多个电商平台及开源数据源收集原始素材,并遵循相应的使用条款。随后,利用Qwen3-VL-32B大语言模型对模特与服装图像进行智能标注,通过重新分组与人工校验确保身份一致性与服装对应关系。在此基础上,生成编辑指令并借助Qwen-Image-Edit-2511合成伪数据,涵盖类内替换、跨类替换及外套去除等多种操作,以支持跨类别与分层试穿任务。每个样本包含至少两个视角的人物图像,其中88%包含背面视角,并提供正反面平铺服装图像以丰富服装参考信息。最终,经由相同的校验流程严格审核合成数据,保障了数据集的高质量与一致性。
特点
OmniView数据集以其大规模与高多样性的特点,显著推动了多视角虚拟试穿的发展。相较于传统数据集,它包含6110个样本,每个样本均提供正反面平铺服装图像,极大提升了服装参考的完整性。在类别覆盖上,除上装、下装与全身装外,创新性地引入外套类别,拓宽了试穿任务的适用范围。尤为重要的是,数据集为每个人物图像合成了伪标签数据,专门支持跨类别与分层试穿,这一设计突破了现有数据集的局限。在质量控制上,借助先进的大语言模型进行自动标注与校验,辅以人工审查,确保了身份一致性与服装对应的精确性。这些特性使OmniView不仅满足了复杂相机视角下的生成需求,也为视频虚拟试穿的mask-free范式提供了坚实的数据基础。
使用方法
OmniView数据集的设计旨在无缝集成到视频虚拟试穿模型的多阶段训练流程中。研究者可利用该数据集微调多帧试穿模型,插入轻量级LoRA适配器以增强跨帧一致性与服装保真度。在训练阶段,数据集支持单视角和多视角服装输入,模型能够学习从单一正面服装图像生成合理的背面视角试穿效果,而多视角服装参考则进一步提升视觉真实性。此外,OmniView的多视角人物图像可直接用于构建图像级伪数据,配合多阶段训练策略,模型可逐步掌握mask-free的试穿区域定位能力,从而减少对昂贵视频级伪数据的依赖。对于评估,该数据集可作为基准,用于测试现有方法在多样视角和复杂任务下的表现,推动算法在真实世界场景中的鲁棒性研究。
背景与挑战
背景概述
OmniView数据集诞生于视频虚拟试穿(VVT)技术迅猛发展的时代,由南京理工大学、中国科学技术大学、新加坡国立大学及美团的研究团队于2026年构建,其核心研究问题聚焦于突破现有VVT方法对显式掩码的依赖以及多视角数据稀缺的瓶颈。该数据集包含6,110个样本,每个样本涵盖至少两个视角的人物图像,88%的样本提供背面视角,并首创了外衣类别及正面与背面的平铺服装图像,还引入伪数据以支持跨类别与分层试穿。OmniView不仅为BooM-VVT框架提供了充足的多视角训练资源,还显著推动了无掩码、多任务视频试穿生成的发展,对电子商务与数字内容创作领域产生了深远影响。
当前挑战
OmniView数据集面临的挑战首先体现在领域层面:现有VVT方法在处理真实世界场景中的大幅度运动、严重遮挡及物体交互时,依赖昂贵且易出错的掩码,而构建大规模视频级伪数据成本高昂,致使无掩码视频试穿难以实现;同时,传统关键帧采样策略忽略与服装无关的身体区域,导致服装一致性受损。其次,在数据构建过程中,从多源平台采集的原始数据存在身份不一致与噪声干扰,需借助Qwen3-VL-32B进行精细标注与人工核验;此外,多视角数据的服装种类与完整性不足,需额外合成伪数据以覆盖多样化试穿任务,整个过程涉及复杂的图像编辑与质量审查,成本高昂且需严格保障数据质量与一致性。
常用场景
经典使用场景
OmniView数据集在虚拟试穿领域树立了新的标杆,尤其服务于多视角视频虚拟试穿任务。其核心应用场景在于为基于关键帧驱动的扩散模型提供大规模、多视角的配对训练数据,从而支撑从单一视角或双视角服装图像生成时序连贯、外观逼真的试穿视频。该数据集覆盖了上衣、下装、全身装及外套等多种服装类别,并创新性地引入了跨类别与分层试穿的伪数据,使得模型能够在复杂相机视角(如背面)及多样化试穿需求下,实现对服装细节的精准捕捉与生成。
衍生相关工作
OmniView的发布催生了多项衍生工作,例如基于其多视角伪数据训练的无掩码视频虚拟试穿框架BooM-VVT,该框架通过引入服装敏感关键帧采样与帧共享3D旋转位置编码,实现了服装外观的高保真转移与时间一致性。此外,该数据集促进了跨类别与分层试穿任务的研究,推动了多视角扩散模型在人物动画与服装编辑领域的交叉应用,成为后续研究验证模型性能的权威基准。
数据集最近研究
最新研究方向
OmniView数据集聚焦于视频虚拟试穿领域的前沿研究,其最新方向在于构建大规模多视角试穿数据集以应对复杂场景下的挑战。该数据集包含6,110个样本,不仅覆盖上装、下装、连衣裙及外套等多类服饰,还提供前后视角的平面服装图像,并引入跨类别与分层试穿的伪数据。研究重点包括通过图像级伪数据驱动无掩膜视频虚拟试穿,结合关键帧敏感采样与帧共享3D-RoPE增强服装一致性与时序连贯性,从而支持多视角、跨类别及分层等多样化试穿任务。OmniView的提出显著缓解了现有数据集规模不足与视角单一的问题,推动了视频虚拟试穿在无约束真实场景中的鲁棒性与泛化能力提升,为电子商务与数字内容创作提供了坚实的数据基础。
相关研究论文
  • 1
    BooM-VVT: Boosting Mask-Free Video Virtual Try-On with Image-Level Pseudo Data南京理工大学; 中国科学技术大学; 新加坡国立大学; 美团 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务