OmniView
收藏资源简介:
OmniView是一个大规模多视角试穿数据集,由研究团队构建,旨在解决现有数据集规模小、类别单一、服装不完整等问题。数据集包含6,110个样本,每个样本提供至少两个视角的人物图像,其中88%包含背面视图,并配有前后平面服装图像。覆盖上衣、下装、全身及外衣四大类别,并通过合成伪数据支持跨类别和分层试穿。数据收集自电商平台和开源数据集,经大语言模型标注、分组、合成伪数据及人工审核确保质量。该数据集主要用于视频虚拟试穿任务,能够提升模型在复杂视角和多样试穿场景下的生成鲁棒性与服装一致性。
OmniView is a large-scale multi-view virtual try-on dataset constructed by a research team, aiming to address the limitations of existing datasets such as small scale, limited category types and incomplete clothing coverage. The dataset consists of 6,110 samples, each providing human images from at least two viewpoints, with 88% of them including back views and paired with front and back flat-lay clothing images. It covers four major clothing categories: tops, bottoms, full-body outfits and outerwear, and supports cross-category and layered try-on via synthesized pseudo data. The data is collected from e-commerce platforms and open-source datasets, and its quality is ensured through LLM-based annotation, grouping, pseudo-data synthesis and manual review. This dataset is primarily used for video virtual try-on tasks, and it can enhance the model's generation robustness and clothing consistency under complex viewpoints and diverse try-on scenarios.
数据集详情:BooM-VVT
BooM-VVT 是一个基于图像级伪数据的无掩码视频虚拟试穿(Mask-Free Video Virtual Try-On)框架。该页面展示了其核心方法、关键贡献及其配套的 OmniView 数据集。
核心任务与目标
该工作旨在解决视频虚拟试穿(VVT)中现有方法依赖掩码(mask)来定位试穿区域的问题。现有方法在处理大幅度运动或严重遮挡时表现脆弱,而构建视频级伪数据成本高昂。BooM-VVT 提出了一套无需掩码的框架,仅利用成本较低的图像级伪数据来学习试穿区域定位,并生成高保真、时间上连贯的试穿视频。
关键贡献
该工作提出了四项核心贡献,共同支撑其无掩码视频试穿能力:
- 多阶段训练策略 (Multi-Stage Training):该策略利用图像级伪数据进行无掩码试穿区域定位学习,显著减少了对昂贵视频级伪数据的依赖。
- 服装敏感关键帧采样 (Garment-Sensitive Keyframe Sampling):根据与服装相关的身体区域来选择关键帧,以更好地跨帧捕获和保留服装外观。
- 帧共享3D旋转位置编码 (Frame-Shared 3D-RoPE):在关键帧与目标帧之间建立时空对应关系,以实现更精确的服装细节迁移。
- OmniView 数据集:一个大规模多视角试穿数据集,包含 6,110 个样本,支持多样化的视角、服装类别和试穿任务。
OmniView 数据集详情
该数据集是 BooM-VVT 框架的组成部分,旨在支持多样化的试穿任务。
- 规模: 包含 6,110 个样本。
- 特点: 支持多视角(Multi-View)、跨类别(Cross-Category)和分层(Layered)试穿任务。
- 用途: 用于支持模型在多样化场景下的试穿能力,如多视角试穿、跨品类试穿(例如不同服装类型间的替换)以及分层试穿(如穿搭多件衣物)。
方法论概览
该框架基于关键帧驱动的视频生成范式。其流程包括:
- 关键帧采样:应用服装敏感关键帧采样选择能最佳展示服装相关身体区域和互补视角的帧。
- 关键帧试穿:通过多帧试穿模型将选定的关键帧处理为一致的试穿图像,可选地以前视图和后视图的服装图像为条件。
- 视频生成:将关键帧结果作为外观令牌输入视频生成模型,利用姿态引导、位置和外观LoRA模块以及帧共享3D-RoPE,将服装细节迁移到整个视频,同时保持运动和背景。
其训练过程分为三个阶段:第一阶段使用带训练时掩码的成对人类视频学习关键帧驱动的视频生成;第二阶段用图像级伪对替代昂贵的视频级监督,迫使模型推断可编辑试穿区域;第三阶段合成并筛选小规模视频级伪样本,以微调无掩码模型,提升时间连贯性和视频质量。
BibTeX 引用信息
该页面提供了 BibTeX 格式的引用条目,具体如下:
bibtex @article{boomvvt2025, title = {BooM-VVT: Boosting Mask-Free Video Virtual Try-On with Image-Level Pseudo Data}, author = {Anonymous}, journal = {arXiv preprint arXiv:XXXX.XXXXX}, year = {2025} }
注:该页面为匿名双盲评审材料,作者和机构信息为匿名状态,论文链接指向本地文件。

- 1BooM-VVT: Boosting Mask-Free Video Virtual Try-On with Image-Level Pseudo Data南京理工大学; 中国科学技术大学; 新加坡国立大学; 美团 · 2026年



