Mover360
收藏资源简介:
Mover360数据集是一个专为360°全景图像中可控物体操纵设计的配对数据集,由惠灵顿维多利亚大学等机构构建。数据集包含12,150个相机-物体序列,每epoch可生成60,750个训练样本对,以及210个合成和50个真实场景测试三元组,覆盖物体平移、移除和插入三种核心任务。数据通过UE5管线生成,采用表面感知物体放置、尺寸适配运动路径及随机光照,确保物理合理性。该数据集旨在解决全景编辑中缺乏配对监督的问题,推动物体级全景操纵的深度学习研究,以保持编辑后场景的全局一致性。
The Mover360 dataset is a paired dataset specifically designed for controllable object manipulation in 360° panoramic images, constructed by institutions including Victoria University of Wellington and others. It contains 12,150 camera-object sequences, which can generate 60,750 training sample pairs per epoch, as well as 210 synthetic and 50 real-world test triplets covering three core tasks: object translation, removal, and insertion. The dataset is generated through the UE5 pipeline, adopting surface-aware object placement, dimension-adaptive motion paths and randomized lighting to ensure physical plausibility. This dataset aims to address the lack of paired supervision in panoramic editing, promote deep learning research on object-level panoramic manipulation, and preserve the global consistency of edited scenes.
Mover360 数据集详情
项目简介
Mover360是一个可控的360°全景图像物体操作框架,专注于在全景图中进行物体的平移(Translation)、插入(Insert)和移除(Remove)操作。该框架直接在等距柱状投影(ERP)域中处理编辑任务,而非传统的透视图像编辑方式。
核心技术
- 基础模型:基于预训练的Flux2-Klein-4B-Base整流流扩散Transformer,通过LoRA适配(rank 32,约3700万可训练参数)进行微调。
- 操作方式:默认点模式下,用户单击即可移动物体,模型会从全景上下文推断合理的物体大小、支撑和光照。
- 输入指令:使用三通道ERP对齐指令图(源区域、目标区域、高斯目标点),统一支持点、边界框和掩码三种引导方式。
- 周期性处理:采用圆形填充处理ERP投影的左右环绕连续性。
数据集构建
项目使用UE5数据生成流程构建训练数据:
- 数据规模:包含12,150个相机-物体序列,覆盖5个场景和608个独特物体,通过动态配对采样扩展为每轮60,750个训练对(其中36,450平移 / 12,150移除 / 12,150插入)。
- 渲染特性:具有表面感知物体放置、基于物体大小的运动路径、多相机全景渲染、随机光照和多视角参考捕获。
- 训练设置:以1024×512分辨率训练8轮(约30K迭代,8块GPU耗时约20小时)。
评估基准
双域基准测试提供:
- 210个保留的合成测试元组(UE5)
- 50个真实拍摄测试元组
- 每个元组均包含所有三个任务的地面真值数据
- 真实数据集特意强调长距离重排:中位大圆位移为50.9°,四分之一的移动超过103°
对比结果
在两种测试域(合成+真实)和两种适应协议(直接ERP编辑、透视投影编辑)下,Mover360在重建保真度、语义一致性和分布质量方面均优于现有的透视编辑、插入和修复基线方法(如GPT-Image-2、Paint-by-Example、OmniPaint、LaMa、Insert-Anything等)。
应用场景
- 虚拟布景与室内设计:单击移动家具、移除杂物、插入物体并保持合理支撑和光照
- VR内容修订:直接编辑已捕获的360°环境而无需重新拍摄场景
资源链接
- 基准下载:Hugging Face
- 代码与使用说明:GitHub
引用信息
论文尚未正式发表,BibTeX为占位符状态,等待提交/录用后更新。





