遇见数据集

Mover360

收藏
arXiv2026-08-24 更新2026-08-26 收录
官方服务:

资源简介:

Mover360数据集是一个专为360°全景图像中可控物体操纵设计的配对数据集,由惠灵顿维多利亚大学等机构构建。数据集包含12,150个相机-物体序列,每epoch可生成60,750个训练样本对,以及210个合成和50个真实场景测试三元组,覆盖物体平移、移除和插入三种核心任务。数据通过UE5管线生成,采用表面感知物体放置、尺寸适配运动路径及随机光照,确保物理合理性。该数据集旨在解决全景编辑中缺乏配对监督的问题,推动物体级全景操纵的深度学习研究,以保持编辑后场景的全局一致性。

The Mover360 dataset is a paired dataset specifically designed for controllable object manipulation in 360° panoramic images, constructed by institutions including Victoria University of Wellington and others. It contains 12,150 camera-object sequences, which can generate 60,750 training sample pairs per epoch, as well as 210 synthetic and 50 real-world test triplets covering three core tasks: object translation, removal, and insertion. The dataset is generated through the UE5 pipeline, adopting surface-aware object placement, dimension-adaptive motion paths and randomized lighting to ensure physical plausibility. This dataset aims to address the lack of paired supervision in panoramic editing, promote deep learning research on object-level panoramic manipulation, and preserve the global consistency of edited scenes.

创建时间:
2026-08-24
原始信息汇总

Mover360 数据集详情

项目简介

Mover360是一个可控的360°全景图像物体操作框架,专注于在全景图中进行物体的平移(Translation)、插入(Insert)和移除(Remove)操作。该框架直接在等距柱状投影(ERP)域中处理编辑任务,而非传统的透视图像编辑方式。

核心技术

  • 基础模型:基于预训练的Flux2-Klein-4B-Base整流流扩散Transformer,通过LoRA适配(rank 32,约3700万可训练参数)进行微调。
  • 操作方式:默认点模式下,用户单击即可移动物体,模型会从全景上下文推断合理的物体大小、支撑和光照。
  • 输入指令:使用三通道ERP对齐指令图(源区域、目标区域、高斯目标点),统一支持点、边界框和掩码三种引导方式。
  • 周期性处理:采用圆形填充处理ERP投影的左右环绕连续性。

数据集构建

项目使用UE5数据生成流程构建训练数据:

  • 数据规模:包含12,150个相机-物体序列,覆盖5个场景和608个独特物体,通过动态配对采样扩展为每轮60,750个训练对(其中36,450平移 / 12,150移除 / 12,150插入)。
  • 渲染特性:具有表面感知物体放置、基于物体大小的运动路径、多相机全景渲染、随机光照和多视角参考捕获。
  • 训练设置:以1024×512分辨率训练8轮(约30K迭代,8块GPU耗时约20小时)。

评估基准

双域基准测试提供:

  • 210个保留的合成测试元组(UE5)
  • 50个真实拍摄测试元组
  • 每个元组均包含所有三个任务的地面真值数据
  • 真实数据集特意强调长距离重排:中位大圆位移为50.9°,四分之一的移动超过103°

对比结果

在两种测试域(合成+真实)和两种适应协议(直接ERP编辑、透视投影编辑)下,Mover360在重建保真度、语义一致性和分布质量方面均优于现有的透视编辑、插入和修复基线方法(如GPT-Image-2、Paint-by-Example、OmniPaint、LaMa、Insert-Anything等)。

应用场景

  • 虚拟布景与室内设计:单击移动家具、移除杂物、插入物体并保持合理支撑和光照
  • VR内容修订:直接编辑已捕获的360°环境而无需重新拍摄场景

资源链接

  • 基准下载:Hugging Face
  • 代码与使用说明:GitHub

引用信息

论文尚未正式发表,BibTeX为占位符状态,等待提交/录用后更新。

搜集汇总
数据集介绍
Mover360 数据集图片
构建方式
Mover360数据集的构建依托于虚幻引擎5(UE5)的生成管线,通过表面感知的对象放置与随机化光照,精心设计了涵盖平移、移除与插入三种任务的配对数据。具体而言,该管线利用60条依对象尺寸定制的运动路径,每条路径由三台全景相机从不同视角捕捉10帧序列,经分层采样后形成12,150个有效的相机-对象序列,每个训练周期可产出60,750个训练样本。真实场景的多样性通过双域测试基准得以体现,包含210个合成场景与50个真实拍摄元组,每个元组均提供三种任务的完整真值标注,从而构建了规模宏大且视角全面的全景编辑数据集。
特点
该数据集的显著特征在于其全景感知的几何设计,充分考量了等距柱状投影(ERP)固有的横向环绕、纬度相关畸变与全局场景连续性。统计表明,对象尺寸跨越两个数量级,平移距离以球面大圆度量,中位数在真实测试集中高达50.9度,其中有四分之一的移动超过103度,这远超常规透视视角的覆盖范围,凸显了全景原生编辑的必要性。此外,真实数据刻意强调远距离重排,挑战模型的泛化能力,而合成数据则提供了多样化的光照条件与多视角参考,为评估提供了坚实而全面的基础。
使用方法
该数据集专为训练与评估Mover360框架设计,该框架以对象平移为核心任务,同时支持参考引导的插入与移除作为辅助功能。使用时,用户可通过统一的交互界面,以单一点选、边界框或精细掩码形式指定源区域与目标区域,而固定提示词与ERP对齐的指令图将空间信息编码为条件,引导扩散Transformer完成编辑操作。评估协议涵盖直接应用于ERP全景与透视重投影两种范式,后者对透视基线算法更为有利,从而提供严格的对比基准。该数据集与公开代码一并发布,便于研究者复现实验并推动全景对象操作领域的发展。
背景与挑战
背景概述
Mover360数据集由惠灵顿维多利亚大学、新南威尔士大学和墨尔本大学的研究人员于2026年创建,旨在解决360度全景图像中可控物体操作的难题。该数据集的核心研究问题是,在等距柱状投影(ERP)格式的全景图像中,实现物体的平移、插入和移除,同时保持全局场景的连续性和光照一致性。Mover360通过构建包含12,150个相机-物体序列的大规模成对训练数据,以及包含真实捕捉样本的双域测试基准,为全景物体编辑提供了首个可量化评估的标准。该数据集显著推动了沉浸式虚拟现实、遥在体验和虚拟布景等应用中的物体级编辑能力,为相关领域的研究提供了坚实的数据基础。
当前挑战
Mover360数据集所面临的挑战主要涉及领域问题和构建过程。在领域层面,ERP全景图像具有水平环绕、纬度相关失真和全局场景连续性的特点,直接应用透视图像编辑模型会导致接缝伪影、物体几何失真、尺度不稳定和空间控制不准确。此外,物体的大范围移动或跨边界操作,以及光照、阴影和反射的全局一致性,都是现有方法难以解决的挑战。在构建过程中,缺乏真实场景中物体编辑前后的成对数据,需要通过UE5渲染管线生成大规模合成数据,并确保物体放置的表面合理性、光照随机化和多视角参考的一致。同时,构建一个同时包含合成和真实数据的基准测试集,以验证模型在跨域场景中的泛化能力,也是一项重要挑战。
常用场景
经典使用场景
Mover360数据集专为360°全景图像中的可控物体操作而设计,其核心场景涵盖物体的平移、移除与插入三类任务。在等距柱状投影(ERP)格式下,全景图像具有水平环绕、纬度相关畸变及全局场景连续性等独特属性,这使得传统的透视图编辑模型难以直接应用。该数据集通过提供大规模成对的全景编辑样本,支持研究者训练和评估能够在全景域中实现物体重定位、背景修复及参考引导插入的模型,尤其适用于需要处理跨大范围移动、近边界物体及全局光照一致性等挑战性场景的研究。
实际应用
在实际应用中,Mover360数据集可服务于虚拟现实内容创作、沉浸式远程呈现、室内场景捕捉、虚拟布景以及环境光照估计等多个领域。例如,室内设计软件可利用该数据集训练的模型,通过单次点击即可将家具移动到新位置或移除不需要的物体,从而实现快速的空间重布置;影视制作中可高效修复全景镜头中的穿帮物体;房地产虚拟展示可自动调整场景内物品的摆放。此外,该数据集支持用户以点、框或掩码等灵活方式指定操作意图,降低了非专业用户的操作门槛,提升了全景编辑工具的实用性与交互性。
衍生相关工作
Mover360数据集的发布催生了一系列后续研究工作。基于其成对数据构建范式,研究者可进一步扩展至视频全景编辑,探索时空一致的物体操作;其面感知放置和光照随机化策略被借鉴用于生成更逼真的合成训练数据,以提升模型跨域泛化能力;此外,该数据集所定义的统一指令图机制启发了多任务全景编辑框架的设计,推动点、框、掩码等多种控制方式在同一模型中的融合。围绕深度条件化和ERP对齐的LoRA适配方案,也为高效参数微调提供了新思路,相关模型已成为全景物体操作任务中常用的对比基准,促进了该领域的持续创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务