遇见数据集

ShenGroup/SceneTrans

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

SceneTrans是一个合成的室内场景图像对(A/B对)数据集,用于场景变化检测或找不同研究。每个图像对展示了同一场景在进行物体级别编辑(包括添加、移动、移除或保持不变)前后的状态,并附带自然语言描述和相应动作。所有场景均使用NVIDIA Isaac Sim 5.1.0从USD资产渲染,提供RGB、深度和分割模态,以及关于变化的地面真实元数据。数据集包含8个室内场景,总计约14,605个图像对,以每个场景的.zip存档形式分发。变更类型分为四类:添加、移动、移除和不变。许可证为Creative Commons Attribution 4.0 International License (CC BY 4.0)。

SceneTrans is a synthetic dataset of paired indoor scene images (A/B pairs) for scene change detection / spot-the-difference research. Each pair shows the same scene before and after an object-level edit — an object being added, moved, removed, or left unchanged — together with a natural-language description and the corresponding action. All scenes are rendered with NVIDIA Isaac Sim 5.1.0 from USD assets, and come with RGB, depth, and segmentation modalities plus ground-truth metadata about what changed. The dataset spans 8 indoor scenes and roughly 14,605 pairs in total, distributed as per-scene .zip archives. Change types include Add, Move, Remove, and Unchanged. Released under the Creative Commons Attribution 4.0 International License (CC BY 4.0).

提供机构:
ShenGroup
搜集汇总
数据集介绍
ShenGroup/SceneTrans 数据集图片
构建方式
SceneTrans数据集基于NVIDIA Isaac Sim 5.1.0仿真平台构建,从USD资产中渲染出8种室内场景,涵盖厨房、卧室、客厅、餐厅等典型环境。每个场景以压缩包形式提供,包含数量不等的图像对,总计约14,605对。每对图像呈现同一场景在物体级别编辑前后的状态,编辑类型包括添加、移动、移除或保持不变。数据集同时提供RGB、深度、分割图以及描述变化的自然语言标注和动作元数据,生成脚本与注释流程在GitHub上公开。
特点
该数据集专为场景变化检测与“找不同”研究设计,具有高度可控性和多样性。每对图像均包含明确的物体级变化分类(添加、移动、移除、不变),并附带自然语言描述以解释变化细节。所有场景通过物理仿真引擎生成,确保图像质量与标签准确性。数据集覆盖8种室内场景,变化样本丰富,且提供多模态数据(RGB、深度、分割),支持从视觉特征提取到问答任务的广泛研究需求。
使用方法
用户可直接下载按场景组织的压缩包,解压后获得图像对及其元数据。数据集兼容图像到文本、视觉问答及特征提取任务,适用于训练变化检测模型或评估“找不同”算法。每对图像的标注包含变化类型和自然语言描述,便于监督学习;多模态数据可扩展至深度感知与分割任务。推荐使用GitHub仓库中的示例代码进行数据加载与预处理,并遵循CC BY 4.0许可协议在学术或非商业项目中引用。
背景与挑战
背景概述
SceneTrans数据集由ShenGroup研究团队于近年来创建,基于NVIDIA Isaac Sim 5.1.0仿真引擎生成,聚焦于室内场景变化检测(spot-the-difference)这一核心计算机视觉问题。该数据集旨在弥补真实场景标注成本高昂且数据量有限的不足,通过合成手段生成包含添加、移动、移除及无变化四种对象级变换的图像对,并辅以自然语言描述与语义分割等元数据。作为首个系统面向机器人操作与场景理解的大规模合成变化检测数据集,SceneTrans为评估模型对动态环境感知与局部差异定位能力提供了标准化基准,推动了视觉问答、特征提取以及空间推理等相关领域的进步。
当前挑战
SceneTrans所面临的领域问题挑战在于场景变化检测需同时辨识细微对象变更与其空间语义,这对模型在自然图像上的泛化能力提出严苛要求,尤其是处理光照、纹理与视角变异时易出现误判。构建过程中,挑战主要源于合成数据的物理保真度与多样性平衡:一方面需借助高仿真引擎模拟真实室内环境,另一方面需确保变化事件的自然过渡,避免因渲染一致性不足导致伪变化;此外,涵盖8类室内场景且自动生成海量配对数据时,需严格标注变化类别并规避类别失衡,客观反映实际应用中的复杂动态分布。
常用场景
经典使用场景
SceneTrans数据集专为室内场景变化检测与“找不同”研究而设计,其核心使用场景是基于图像对(A/B对)识别场景中物体的增减、移动或保持不变。研究者可利用该数据集训练模型,从RGB、深度或分割模态中精准定位变化区域,并理解对应的自然语言描述。该数据集凭借合成数据的可控性和多样性,为评估变化检测算法的鲁棒性提供了标准化基准,尤其适用于需要细粒度物体级理解的任务。
解决学术问题
该数据集主要解决了室内场景中物体级变化检测的标注稀缺与场景多样性不足的学术难题。通过合成8种室内场景的14,605对图像,它填补了真实数据集中缺乏精确变化标签的空白,使得研究者能够系统性地训练和评估模型在添加、移动、移除等操作下的泛化能力。其意义在于推动视觉推理从像素级差异向语义级理解转变,为场景理解、环境监控和自动驾驶等领域的学术探索提供了关键数据支持。
衍生相关工作
SceneTrans数据集催生了多项相关研究工作,包括基于深度学习的场景变化检测网络、跨模态视觉语言对齐模型以及零样本变化定位方法。其图像对与自然语言描述的配对形式,启发了一系列结合视觉Transformer和语言模型的联合推理框架。同时,该数据集的合成流程(基于NVIDIA Isaac Sim)为其他研究者创建类似资产提供了可复现的模板,推动了合成数据在机器人视觉和场景理解任务中的规范化应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务