遇见数据集

SceneEdit3D-15K

收藏
arXiv2026-06-11 更新2026-06-13 收录
官方服务:

资源简介:

SceneEdit3D-15K是由华东师范大学、上海人工智能实验室等机构联合构建的大规模三维场景编辑数据集,旨在为标准化评估提供高质量的配对监督数据。该数据集包含15,000个精心配对的场景编辑样本,每个样本均提供了完整的RGB视频、深度图、相机参数、编辑掩码以及语言指令等多模态标注信息,数据来源于基于Blender渲染的可组合室内场景。其创建过程通过视觉语言模型提出规范的编辑任务,经可行性检查和渲染管线生成配对数据,确保了三维结构的一致性。该数据集主要应用于三维场景编辑算法的训练与评估,致力于解决现有方法缺乏配对三维标注、难以量化评估编辑保真度与几何一致性的核心瓶颈问题。

SceneEdit3D-15K is a large-scale 3D scene editing dataset jointly constructed by East China Normal University, Shanghai AI Laboratory and other institutions, aiming to provide high-quality paired supervised data for standardized evaluation. This dataset contains 15,000 meticulously paired scene editing samples, each of which provides multi-modal annotation information including complete RGB videos, depth maps, camera parameters, editing masks and language instructions. The data is sourced from compositional indoor scenes rendered based on Blender. Its creation process proposes standardized editing tasks via visual-language models, generates paired data through feasibility checks and rendering pipelines, ensuring the consistency of 3D structures. This dataset is mainly applied to the training and evaluation of 3D scene editing algorithms, and is committed to resolving the core bottleneck problem that existing methods lack paired 3D annotations and struggle to quantitatively evaluate editing fidelity and geometric consistency.

创建时间:
2026-06-11
原始信息汇总

数据集名称

SceneEdit3D,包含两个主要部分:

  • SceneEdit3D-15K:15K 个配对的编辑样本,覆盖场景级物体移除、移动、外观编辑和混合操作。
  • SceneEdit3D-Bench:一个精选的 100 样本基准测试集,用于评估编辑保真度、背景保持和3D结构质量。

数据集内容

  • 数据来源:从可组合的3D室内场景出发,使用视觉语言模型(VLM)提出规范编辑,在 Blender 中执行编辑,并渲染配对的原/目标视频。
  • 标注信息:包含 RGB、深度、相机参数、掩码、编辑参考帧和指令监督,以及渲染器提供的几何、相机、掩码和辅助监督,支持RGB-几何编辑和评估。
  • 样本格式:每对样本包含原视频与编辑后视频、半透明掩码覆盖、编辑提示示例,以及原/编辑后的3D点云预览。

数据集用途

用于训练和标准化评估前馈式3D场景编辑方法,特别是为论文提出的 JointEdit3D 框架提供训练数据和评测基准。

数据规模与特点

  • 15K 配对编辑样本,覆盖5种操作类型:删除、添加、移动、外观编辑和混合操作。
  • 提供渲染器输出的3D标注,包括几何、相机、掩码等,支持 RGB-几何联合编辑和三维结构质量的评估。
  • 基准测试包含 100 个样本,用于衡量编辑区域质量、背景保持能力和3D结构完整性。
搜集汇总
数据集介绍
SceneEdit3D-15K 数据集图片
构建方式
SceneEdit3D-15K基于Imaginarium可组合室内场景构建,通过三个阶段的流水线生成配对编辑样本。首先,从Imaginarium中提取包含物体网格、材质、光照和相机元数据的可编辑三维场景。其次,由视觉语言模型分析场景渲染图与布局信息,提出删除、移动、材质替换等规范编辑任务。最后,Blender在相同相机轨迹下确定性执行编辑动作,渲染出源视频与编辑后视频,并同步输出编辑掩码、深度图、相机参数及语言指令。通过交换前后状态和时间反转,额外生成添加和反向移动样本,最终构建出包含15K配对样本的数据集。
特点
SceneEdit3D-15K具备多项独特优势。作为首个大规模配对场景级三维编辑数据集,它提供严格的像素级对齐,确保源与编辑后视频在相同视角下形成一一对应的观测对。每个样本都附带渲染器提供的三维标注,包括深度图、相机内外参、编辑掩码和自然语言指令,支持对编辑区域质量、背景保真度与三维结构完整性的全面评估。数据集涵盖删除、添加、移动、外观变化及多操作组合等五种编辑类型,编辑对象尺度、位置与遮挡程度呈现丰富多样性,为训练和评测提供高度标准化的基准。
使用方法
该数据集支持灵活的监督学习与评估范式。训练时,模型接收源RGB视频、单帧编辑参考图像及语言指令作为输入,以编辑后的RGB视频和由VGGT与Geometry Adapter派生的几何潜在码作为学习目标,通过流匹配损失进行优化。数据集提供的三维标注(如深度、掩码、相机参数)用于评估阶段的量化指标计算,不在训练中直接使用。SceneEdit3D-Bench作为精选的100样本测试子集,场景与训练集完全分离,支持跨编辑类型的分区域性能对比,包括编辑区域质量、背景保持程度及三维重建精度,为不同方法提供统一、公平的评测平台。
背景与挑战
背景概述
SceneEdit3D-15K数据集由华东师范大学与上海人工智能实验室于2026年联合创建,旨在填补三维场景编辑领域缺乏配对监督与标准化评估基准的空白。核心研究问题聚焦于如何在统一的外观-几何隐空间内实现前馈式三维场景编辑,突破传统基于逐场景优化或级联编辑-重建范式的局限。该数据集包含15,000个配对编辑样本,涵盖删除、添加、移动、外观修改及复合操作等五类编辑任务,并提供渲染器生成的三维标注、编辑掩码、深度图及相机参数。其发布为三维场景编辑提供首个大规模配对数据集,推动从二维驱动编辑向三维联合编辑范式的转变,对提升编辑区域的几何完整性与跨视角一致性具有重要影响力。
当前挑战
SceneEdit3D-15K所应对的领域挑战在于三维场景编辑需同时保持场景几何结构、跨视角一致性及未编辑区域的完整性,而现有方法常将外观合成与几何预测解耦,导致编辑区域出现结构断裂或视角不一致。构建过程中面临的核心挑战包括:如何在单一参考帧条件下实现非对称隐空间修补,即仅从观测到的编辑RGB潜在表示生成剩余视角的RGB与几何信息;如何设计源场景锚定机制以在无显式掩码条件下精准保留未编辑内容;以及如何构建区域分解损失函数,平衡稀疏编辑区域与背景区域的优化权重,避免大面积未变区域主导训练目标。此外,确保合成场景中物体间物理支撑关系、碰撞检测及遮挡处理的合理性也是一大难题。
常用场景
经典使用场景
SceneEdit3D-15K作为首个大规模、成对出现的场景级三维编辑数据集,其最经典的使用场景在于为前馈式三维编辑模型提供端到端的监督训练。通过包含15,000组精配对编辑样本,每组样本均提供编辑前后的RGB视频、编辑参考帧、自然语言指令以及渲染器提供的精确深度图和相机参数,该数据集使得模型能够在统一的潜空间中同时学习外观合成与几何预测,实现单参考帧引导下的多视角一致编辑,从而显著提升编辑区域的质量与三维结构的完整性。
实际应用
在实际应用中,SceneEdit3D-15K扮演着三维内容创作与虚拟场景编辑平台的基石角色。它支持五种典型编辑操作——物体删除、添加、搬移、外观更换及复合操作,使其天然适用于室内设计中的家具布局调整、虚拟现实场景的动态修改、影视后期中的物体移除与替换等工业场景。结合其生成的前馈编辑框架,用户仅需提供一张编辑参考图和可选语言指令,即可自动完成全场景的跨视角编辑,大幅降低了三维编辑的时间成本与操作门槛。
衍生相关工作
SceneEdit3D-15K的发布直接推动了多项经典工作的诞生。其中JointEdit3D正是基于该数据集训练的前馈式编辑框架,通过引入场景锚定分支和编辑感知损失函数,开创性地实现了RGB与几何联合潜空间中的非对称修补。此外,该数据集还启发了Omni-3DEdit等通用型三维编辑模型,并可用于评估MVInpainter等多视角修补方法在三维场景上的泛化能力。其提供的成对标注与三维真值,还催生了关于编辑掩码自动定位、跨视角光照转移等方向的研究,成为三维场景编辑领域继SPIn-NeRF、GaussianEditor等早期工作后最重要的基准资源之一。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务