OpenRC
收藏官方服务:
资源简介:
OpenRC数据集包含使用机器人结肠镜框架在真实结肠模型上收集的同步多模态轨迹,涵盖导航、扫描和失败/恢复场景。
The OpenRC Dataset contains synchronized multimodal trajectories collected on a physical colon model using a robotic colonoscopy framework, covering navigation, scanning, and failure/recovery scenarios.
创建时间:
2026-06-21
原始信息汇总
数据集概述
OpenRC 是一个开源机器人结肠镜检查框架,旨在将传统临床结肠镜机器人化,同时不改变其工作流程。该数据集由德克萨斯大学奥斯汀分校 ARTS 实验室发布,用于支持机器人结肠镜、模仿学习、视觉-语言-动作学习及手术自主性研究。
核心信息
- 发布机构: Advanced Robotic Technologies for Surgery (ARTS) Lab, The University of Texas at Austin
- 关联论文: MICCAI 2026 论文及 arXiv 预印本 (arXiv:2604.03781, arXiv:2509.10735)
- 数据集许可证: CC BY 4.0
- 托管平台: HuggingFace,位于 NVIDIA 的 PhysicalAI Open-H-Embodiment 集合中
- 存储路径:
nvidia/PhysicalAI-Robotics-Open-H-Embodiment→Endoscopy/ut_austin/arts_lab/colonoscope_lerobot
数据集规模与内容
- 总帧数: 2,095,587 帧(约 19.4 小时视频)
- 轨迹数量: 1,894 条遥操作轨迹
- 数据总大小: 19.7 GB
- 采集信息: 由 5 位中等技能操作员在 2025 年 11 月至 2026 年 1 月期间完成,涵盖 10 种结构化任务变体
- 任务范围: 包括常规导航、诱导故障事件和恢复行为
数据模态与格式
- 格式: LeRobot 格式 v2.1,需要
lerobot==0.33 - 同步方式: 基于 ROS2 Humble 和校准的时间对齐
- 数据字段:
| 字段 | 类型/形状 | 描述 |
|---|---|---|
observation.images.endoscope |
video [396, 383, 3] |
内窥镜 RGB 摄像头视频 (AV1/yuv420p, 30 fps) |
observation.state |
int32 [3] |
三个电机的位置: motor_1, motor_2, motor_3 |
observation.ndi_cartesian_absolute |
float32 [7] |
NDI 坐标系下的绝对尖端位姿 (x, y, z, qx, qy, qz, qw) |
observation.ndi_cartesian_relative |
float32 [6] |
相对尖端运动 (dx, dy, dz, droll, dpitch, dyaw) |
action |
float32 [4] |
操作指令: bend_x, bend_y, insertion, home (范围: 弯曲/插入为 [-1, 1],home 为 [0, 1]) |
数据获取与使用
- 下载: 通过 HuggingFace
snapshot_download下载指定子集。 - 加载: 使用 LeRobot API (
LeRobotDataset) 读取数据。 - 可视化: 提供
lerobot_dataset_viz.py脚本,基于 Rerun 库逐帧查看数据。
搜集汇总
数据集介绍

构建方式
OpenRC数据集的构建基于一套创新的开源机器人化结肠镜平台,该平台在不改变传统临床结肠镜工作流程的前提下,通过模块化夹持式硬件实现镜体的自动化操控。具体而言,研究者设计了两套可3D打印的独立驱动模块:进给模块通过电机驱动花键轴与滚轮机构实现镜体的插入与回退,弯曲模块则利用嵌套式夹头抓取镜体原有的转向旋钮,经由齿轮传动完成末端偏转。所有操作指令、低层级电机状态、内窥镜视频流以及由电磁追踪传感器记录的远端尖端六自由度位姿,均通过ROS2框架实现毫秒级同步采集与存储,最终形成包含1,894条遥操作轨迹、超过200万帧图像的多模态数据集。
特点
该数据集的显著特色在于其多模态信息的精细对齐与任务覆盖的广度。每条轨迹均同步记录了内窥镜RGB视频、三自由度电机位置、电磁追踪器提供的绝对与相对位姿,以及四维操作指令(弯曲方向、插入与复位)。数据采集由五位中等熟练度的操作者完成,涵盖了常规导航、息肉扫描、以及刻意诱发的失败与恢复等十种结构化任务变体,总计约19.4小时的交互时长。这种设计不仅保证了数据在时间维度上的高度一致性,更通过包含故障场景为模仿学习、视觉-语言-动作模型等自主化研究提供了丰富的难例样本。
使用方法
数据集以LeRobot v2.1格式托管于HuggingFace平台,使用者需首先通过huggingface_hub库的snapshot_download函数下载指定子目录,随后利用lerobot库中的LeRobotDataset API加载数据。加载后的数据集支持Pythonic的索引访问,单帧样本同时包含观测图像、状态向量与动作标签。为便于探索,项目还提供了基于Rerun库的可视化脚本,允许研究者逐帧回放任意轨迹的时序信息,结合视频、操作指令与尖端位姿的联动展示,直观理解手术操作的动态过程。这种标准化的数据接口与可视化工具大大降低了研究方法复现与模型训练的门槛。
背景与挑战
背景概述
结直肠癌筛查中,结肠镜检查是金标准,然而传统操作依赖医师的手工技巧,存在学习曲线陡峭、操作疲劳及视野不稳定等局限。为突破这一瓶颈,OpenRC数据集应运而生,由德克萨斯大学奥斯汀分校ARTS实验室的Siddhartha Kapuria、Farshid Alambeigi等人于2026年在MICCAI会议上提出。该数据集聚焦于将传统临床结肠镜机器人化,在不改变现有工作流程的前提下,通过模块化夹持装置驱动镜身插入与弯角旋钮,同步采集内镜视频、操作指令、底层电机状态及远端6自由度位姿等多模态数据,为机器人结肠镜、模仿学习及视觉-语言-动作模型的研究提供了标准化实验平台。自发布以来,OpenRC凭借其开源硬件设计与近1900条轨迹的大规模多模态数据,显著推动了手术自主性领域的发展。
当前挑战
OpenRC所解决的领域核心挑战在于,传统结肠镜操作高度依赖医师的手眼协调与经验判断,难以实现自动导航与标准化技能迁移,而现有数据集多为单模态或非同步记录,缺乏底层控制信号与精准位姿的联合标注。在数据构建过程中,团队面临诸多实际难题:如何在不破坏临床结肠镜原有结构的前提下实现高精度驱动,需设计解耦的喂入与弯角模块并确保机械兼容性;多传感器数据的时间同步,需在ROS2框架下通过校准算法对齐30fps内镜视频、电磁跟踪器及控制器信号;此外,为覆盖导航、扫描及故障恢复等复杂临床场景,数据集需由多名不同熟练度的操作者在定制结肠模型上反复采集,以保证数据的多样性与鲁棒性。
常用场景
经典使用场景
在微创手术机器人研究领域,OpenRC数据集为结肠镜检查的自主化与智能化提供了关键的数据基础。其经典使用场景聚焦于模仿学习与视觉-语言-动作联合建模,研究者可利用该数据集中1,894条遥操作轨迹,涵盖腔内导航、病灶扫描及失败恢复等结构化任务,训练智能体在真实临床器械上复现操作策略。数据集同步记录了内窥镜视频、操作指令、电机状态及末端六自由度位姿,为端到端策略学习、多模态感知融合及闭环控制方法提供了高保真的训练与验证平台。
实际应用
在实际医疗场景中,OpenRC数据集的核心价值在于赋能新型手术辅助系统与半自主操控界面的开发。基于内窥镜视频与操作映射关系,可训练智能体实现自适应视野保持、自动回拉及过弯避障功能,显著降低新手医师的学习曲线。此外,该数据集的低层电机状态与操作指令的关联性,可直接支持触觉反馈算法设计,使远程手术系统能够模拟术者手感。通过电磁位姿的真实轨迹记录,还为术后器械路径评估与数字化手术日志生成提供了临床级数据支撑。
衍生相关工作
围绕OpenRC平台与数据集,已衍生出一系列关键技术工作。配套发表的机械设计论文详细阐述了送管与弯曲模块的解析优化方法,提供了可复现的3D打印加工方案。依托LeRobot格式的标准化多模态数据,催生了面向手术机器人领域的模仿学习基准测试协议。视觉-语言-动作联合模型的先驱研究也借助该数据集探索了内窥镜场景下自然语言指令对操作策略的引导能力。此外,面向结肠镜自主化的强化学习环境构建与故障重试策略优化等工作均以OpenRC作为核心数据基础。
以上内容由遇见数据集搜集并总结生成



