遇见数据集

RoboNever

收藏
github2026-06-12 更新2026-06-16 收录
官方服务:

资源简介:

RoboNever是一个高质量的真实世界机器人数据集,专为研究视觉-语言-动作(VLA)模型中的持续学习而设计。它包含2000个在Piper双臂机器人上收集的片段,涵盖四个多样化的任务:刚性操作、铰接物体、可变形物体和接触密集型任务。每个片段有4个同步摄像头视图,数据格式兼容HuggingFace LeRobot库,适用于研究灾难性遗忘。

RoboNever is a high-quality real-world robotic dataset specifically designed for research on continual learning in Vision-Language-Action (VLA) models. It contains 2000 episodes collected on a Piper dual-arm robot, covering four diverse task categories: rigid-body manipulation, articulated objects, deformable objects, and contact-intensive tasks. Each episode includes four synchronized camera views, and its data format is compatible with the HuggingFace LeRobot library, making it suitable for studies on catastrophic forgetting.

创建时间:
2026-06-11
原始信息汇总

RoboNever 数据集详情

数据集简介

RoboNever 是一个高质量的真实世界机器人数据集,专为研究视觉-语言-动作(VLA)模型中的持续学习(continual learning)而设计。

核心特点

  • 真实机器人数据:在 Piper 双臂机器人上采集的 2,000 个 episode
  • 4 种多样化任务:刚性操控、铰接物体、可变形物体、接触丰富任务
  • 多视角摄像头:每个 episode 包含 4 个同步摄像头视角
  • LeRobot 格式:可直接与 HuggingFace LeRobot 库配合使用
  • 持续学习:专门设计用于研究灾难性遗忘问题

任务概览

任务 Episode 数量 帧数 描述 类型
Stack Bowls 500 129,612 拾取并叠放碗 刚性操控
Hang Cup 500 149,372 将杯子挂在架子上 铰接物体
Fold Towel 500 213,047 折叠可变形的毛巾 可变形物体
Press Button 500 67,955 精确按下按钮 接触丰富

数据规格

  • 机器人:Piper 双臂机器人,14 自由度(每只手臂 6 个关节 + 1 个夹爪)
  • 摄像头:4 个同步视角(head、left_wrist、right_wrist、front_view),分辨率 480×640
  • 帧率:30 FPS
  • 格式:H.264 视频、Parquet(状态/动作数据)、MP4(视频文件)

数据目录结构

cl-piper-single-<task>/ |-- data/ | +-- chunk-000/ | |-- episode_000000.parquet | |-- episode_000001.parquet | +-- ... (500 episodes) |-- meta/ | |-- info.json # 数据集元数据 | |-- episodes.jsonl # Episode 级别信息 | |-- episodes_stats.jsonl # 每个 episode 的统计信息 | |-- tasks.jsonl # 任务描述 | +-- modality.json # 特征映射 +-- videos/ +-- chunk-000/ |-- observation.images.head/ |-- observation.images.left_wrist/ |-- observation.images.right_wrist/ +-- observation.images.front_view/

任务指令

每个任务包含一条自然语言指令:

任务 语言指令
Stack Bowls "stack the yellow bowl on the green bowl"
Hang Cup "hang the purple cup on the mug rack"
Fold Towel "fold the grey towel"
Press Button "press the green button"

快速使用

1. 安装依赖

bash pip install lerobot huggingface_hub

2. 加载数据集

python from lerobot.common.datasets.lerobot_dataset import LeRobotDataset

ds = LeRobotDataset("Ray0v0/cl-piper-single-stack-bowls")

print(f"Episodes: {ds.num_episodes}") print(f"Total Frames: {len(ds)}") print(f"Sample keys: {ds[0].keys()}")

3. 下载所有数据集

bash huggingface-cli login

for task in stack-bowls hang-cup fold-towel press-button; do huggingface-cli download "Ray0v0/cl-piper-single-${task}" --repo-type dataset --local-dir "./data/cl-piper-single-${task}" done

相关项目

  • ContinualVLA:持续学习实验的官方实现
  • openpi:Physical Intelligence 的基础代码库
  • LeRobot:HuggingFace 的机器人学习库

数据集引用

bibtex @article{zhu2026continualvla, title={Can VLA Models Learn from Real-World Data Continually without Forgetting?}, author={Zhu, Jiarun and Hong, Yijun and Sun, Xiaoquan and Xu, Zetian and Yuan, Mingqi and Wang, Zhiyong and Zeng, Wenjun and Chen, Jiayu}, journal={arXiv preprint arXiv:2605.26820}, year={2026} }

许可证

该数据集采用 MIT License 发布。

搜集汇总
数据集介绍
RoboNever 数据集图片
构建方式
RoboNever数据集由香港大学Agentic Intelligence Lab在Piper双臂机器人平台上采集,专门为研究视觉-语言-动作(VLA)模型中的持续学习问题而构建。数据集包含2000个高质量真实世界机器人操作片段,涵盖四种典型的操作任务:刚体堆叠(叠碗)、铰接物体操作(挂杯)、可变形物体操作(叠毛巾)以及高精度接触式任务(按按钮)。每个任务采集500个片段,并在每个片段中同步记录4个视角(头部、左腕、右腕及前视)的480×640分辨率RGB视频,以30帧每秒的帧率捕获完整的操作过程。数据采用LeRobot标准格式组织,机器人状态和动作以Parquet文件存储,视频以H.264编码的MP4文件保存,极大地方便了研究者的解析和使用。
使用方法
使用RoboNever数据集需要先安装LeRobot和HuggingFace Hub相关依赖。研究者可通过huggingface-cli登录后,使用简单的Python代码即可加载任意任务子集,例如通过LeRobotDataset类直接获取叠碗任务的完整片段和帧数据。每个数据样本包含多视角图像、机器人关节角度、夹爪状态及对应的自然语言指令,可直接用于VLA模型的训练和评估。更为便捷的是,该数据集已深度整合至ContinualVLA持续学习框架中,用户只需克隆该代码库并运行预设的数据下载与训练脚本,即可迅速复现论文中的持续学习实验流程,无需自行设计数据加载和任务调度逻辑。
背景与挑战
背景概述
在机器人学习领域,视觉-语言-动作(VLA)模型在处理多模态信息方面展现出巨大潜力,然而它们在实际应用中面临一个关键瓶颈:在持续学习过程中,模型往往会出现灾难性遗忘,即学习新任务时丢失已掌握技能。为系统研究这一挑战,香港大学Agentic Intelligence Lab的研究团队于2026年创建了RoboNever数据集。该数据集由Zhu Jiarun等人主导构建,包含2000条高质量真实机器人操作片段,涵盖刚性操作、铰接物体、可变形物体及接触丰富型任务四大类别,每个片段均配备四视角同步视频数据。RoboNever的发布为评估VLA模型在连续学习任务中的知识保留能力提供了标准化基准,显著推动了持续学习在具身智能领域的研究进展。
当前挑战
RoboNever数据集旨在解决VLA模型在连续学习场景中的灾难性遗忘问题,其核心挑战包括:领域任务层面,机器人操作任务天然具有多样性(如折叠毛巾与按按钮存在巨大运动学和动力学差异),且任务顺序编排复杂,极易导致旧知识的灾难性遗忘;构建层面,数据集需在Piper双机械臂平台上采集多视角高质量演示数据,四台相机同步校准与时间对齐难度较高,同时要确保每个任务500个片段的技能多样性,避免机械重复。此外,帕累托数据格式的存储优化与大规模视频处理也对硬件资源提出严苛要求。
常用场景
经典使用场景
在持续学习(Continual Learning)研究领域,RoboNever数据集为评估视觉-语言-动作(VLA)模型在真实机器人操作任务中的灾难性遗忘现象提供了标准化的实验平台。该数据集包含四项具有代表性的操作任务——刚性物体堆叠(Stack Bowls)、铰接物体操控(Hang Cup)、柔性物体折叠(Fold Towel)以及高精度接触式任务(Press Button),每项任务均采集了500个示范片段,并配备四视角同步摄像头记录。研究者可基于LeRobot格式的数据加载接口,方便地设置任务序列,按顺序训练VLA模型并评估其在学习新任务时对旧任务表现的影响,从而系统性地探究持续学习算法的有效性。
解决学术问题
该数据集填补了机器人持续学习研究中缺乏高质量真实世界多任务基准的空白,主要解决了三个关键学术问题:首先,提供了涵盖刚性、铰接、柔性和接触式等不同物理交互特性的多样化任务集合,使得研究者能够全面评估模型在面对异构操作场景时的遗忘特性;其次,通过标准化的数据采集流程和任务指令(如“将黄色碗叠放在绿色碗上”),为持续学习中的任务增量学习(Task-Incremental Learning)提供了明确的评估准则;最后,推动了VLA模型在真实机器人上实现“学而不忘”的能力研究,打破了传统深度学习中单一任务训练范式,为构建能持续进化的通用机器人智能体奠定了数据基础。
实际应用
在实际应用中,RoboNever数据集所支持的持续学习技术可赋能机器人部署于动态非结构化环境,例如家庭服务、医疗辅助和工业柔性制造等领域。以家庭场景为例,机器人可先通过该数据集学习叠放碗碟、悬挂杯子等基础技能,随后在不遗忘前述能力的前提下,继续学习折叠毛巾或按下精密按钮等新任务,从而逐步掌握完整的家务操作流程。在工业场景中,机器人生产线需频繁切换不同产品型号的装配任务,持续学习能力确保其能快速适应新工序而无需完全重新训练,显著降低部署成本。此外,该数据集的多视角视频和状态-动作记录格式可直接用于迁移学习,加速机器人从仿真环境到真实世界的技能迁移。
数据集最近研究
最新研究方向
针对视觉-语言-动作(VLA)模型在真实机器人操作场景中的持续学习问题,RoboNever数据集应运而生。该数据集由香港大学Agentic Intelligence Lab发布,包含2000个真实机器人操作片段,覆盖刚性操作、铰接物体、可变形物体及高精度接触式任务四大类别,并采用多视角同步采集策略。其核心价值在于为评测和缓解灾难性遗忘现象提供了标准化、多样化的基准平台,推动了持续学习范式从静态图像分类向动态机器人操控领域的迁移,与当前工业界对机器人在非结构化环境中自适应能力的迫切需求高度契合。该数据集通过精细的任务划分与语言指令对齐,为实现无需重放全部历史数据即可增量式学习知识的VLA模型奠定了关键数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务