InternRobotics/REAL-Data
收藏官方服务:
资源简介:
该数据集发布包含REAL使用的七个实验特定的、经过处理的GRScenes阶段。这些**不是**原始同名的GRScenes阶段。场景依赖关系闭包是使用InternUtopia的`toolkits/grscenes_scripts/export_scenes.py`导出的,并进行了本地化、修剪和验证。
This dataset release contains the seven experiment-specific, processed GRScenes stages used by REAL. These are **not** the original same-named GRScenes stages. The scene dependency closure was exported with InternUtopias `toolkits/grscenes_scripts/export_scenes.py`, localized, pruned, and verified.
提供机构:
InternRobotics搜集汇总
数据集介绍

构建方式
REAL-Data数据集由七个经过专门处理的GRScenes场景构成,这些场景并非原始同名场景,而是通过InternUtopia工具包中的`export_scenes.py`脚本导出场景依赖闭包,经过本地化、裁剪和验证后生成的。数据以单一压缩包形式分发,包含场景入口点、模型、材质、纹理、MDL依赖闭包、占用地图、逐场景家具库以及经处理的任务生成器元数据,其中元数据记录了MesaTask原始ID与USD有效ID的对应关系。数据包结构清晰,分为scenes、models、Materials、metadata等子目录,并提供manifest.json和SHA256SUMS文件用于溯源和完整性校验。
特点
该数据集的核心特点在于其高度加工和验证的场景数据,确保了无符号链接、无未解析的外部USD依赖及私有集群路径,体现了对数据质量的严谨把控。每个场景均通过原始终端UID标识,并附带完整的材质、纹理和MDL闭包,支持即用型仿真部署。此外,数据集明确区分了可重新分发的GRScenes场景与需单独获取的MesaTask对象USD载荷,在许可证上采用CC BY-NC-SA 4.0协议,强调非商业用途和署名共享要求,体现了对上游数据版权的尊重。
使用方法
使用REAL-Data时,首先通过Hugging Face CLI下载压缩包及校验文件,利用`sha256sum`验证完整性后,使用`zstd`解压至本地目录。解压后的目录包含场景USD入口点(位于`scenes/<scene_id>_usd/scene.usd`),可直接在REAL框架中加载。运行前需确保MesaTask-10K数据集已单独获取,并配置环境变量`MESATASK_USD_ROOT`指向其路径。扩展使用可参照manifest.json中的场景指纹和依赖计数进行自定义场景组装,或利用元数据中的ID对应关系开发任务生成逻辑。
背景与挑战
背景概述
REAL-Data是由InternRobotics团队在近期发布的一个面向具身智能与机器人仿真研究的数据集。该数据集源自GRScenes,经过场景依赖闭包导出、本地化、剪枝及验证等处理,最终包含七个实验专用的场景入口点,并以USD格式提供完整的场景模型、材质、纹理及MDL闭包。其核心研究问题在于为机器人学习与具身智能提供高保真、可复现的仿真环境,从而弥合模拟与真实世界之间的差距。通过提供经过严格校验的场景数据与任务生成元信息,REAL-Data有望推动机器人操控、场景理解及任务规划等领域的算法发展,成为连接仿真研究与实际部署的关键桥梁。
当前挑战
REAL-Data所解决的领域挑战在于提升仿真数据在机器人研究中的可用性与可靠性。传统仿真数据集往往缺乏场景一致性、依赖关系不完整或包含私有路径,导致复现困难与跨场景泛化性能下降。为此,数据集构建者需应对大规模场景数据的依赖闭包导出、无符号链接验证及SHA256完整性校验等工程难题,确保数据在分发与使用过程中的可复现性。此外,MesaTask对象USD载荷并未随数据集重新分发,用户需单独获取并配置`MESATASK_USD_ROOT`,这一外部依赖增加了数据集的部署复杂度,成为研究者快速上手的一大障碍。
常用场景
经典使用场景
在具身智能与机器人学领域,REAL-Data数据集作为经过精细处理的GRScenes场景子集,为机器人操作任务提供了标准化的仿真环境。其经典使用场景集中于利用预处理的场景闭包、占据地图及家具库,在物理仿真器中复现真实世界的室内布局与物体交互关系。研究者可加载这七个实验专用场景,直接开展基于视觉的运动规划、抓取姿态估计以及长时序任务推理等研究,无需重复构建复杂的三维资产依赖。该数据集的USD格式入口点与完整性校验机制,确保了仿真实验的可复现性与场景一致性,成为连接算法开发与实物部署的关键桥梁。
解决学术问题
REAL-Data数据集系统性地解决了机器人仿真训练中场景资产碎片化与依赖冲突的学术难题。通过将GRScenes的原始场景闭包进行本地化裁剪与完整性验证,它消除了外部USD依赖与私有路径引用,保障了场景在异构仿真平台间的可移植性。这使研究者得以聚焦于策略学习与任务泛化本身,而非陷于资产兼容性调试。该数据集提供的元数据映射机制,特别是MesaTask原始标识符与有效USD标识符的对应关系,大幅降低了任务生成器与仿真引擎之间的集成门槛,推动了场景理解、人机交互及多任务学习的标准化进程。
衍生相关工作
围绕REAL-Data数据集,学术界已衍生出多项具有影响力的工作。其上游GRScenes场景库为场景理解与仿真环境生成提供了基础框架。基于REAL-Data的占据地图与家具库,研究者发展了面向复杂交互的接触感知策略学习方法,提升了操作任务的成功率。该数据集与MesaTask-10K的协同关系,催生了针对长时序任务中物体重排与工具使用的层次化规划算法。此外,场景完整性验证的实践范式被后续仿真基准测试采纳,推动了机器人学中数据版本控制与可复现性标准的建立。这些衍生工作共同强化了数据集作为具身智能研究基础设施的学术价值。
以上内容由遇见数据集搜集并总结生成



