Discoverse-L
收藏资源简介:
Discoverse-L是一个基于DISCOVERSE模拟器和AIRBOT-Play机器人平台构建的长时域操作基准,旨在为多阶段机器人操作任务提供标准化评估和训练数据。该数据集包含三个不同难度的多阶段任务:Block Bridge(74个阶段,需放置两个杆形成桥梁结构并填充多个方块)、Stack(18个阶段,需按顺序堆叠三个彩色方块)和Jujube-Cup(19个阶段,需将一颗枣放入杯子并将杯子移动到盘子上)。每个任务提供50条脚本化演示轨迹,总计150条轨迹。每条轨迹包含时间对齐的关节状态和动作数据(obs_action.json),以及两个视角的视频文件(主摄像头和腕部摄像头,分辨率448×448,帧率20FPS)。此外,数据集提供了任务对齐的归一化统计量(包括均值、标准差、最小值、最大值、第1和第99百分位数及关节掩码)以支持跨任务训练,以及由Gemini-2.5-Pro生成的阶段字典,每个阶段包含正例、负例和难负例文本描述。该数据集适用于长时域操作策略学习、跨任务泛化研究以及多阶段机器人操作任务的基准测试。
Discoverse-L is a long-horizon manipulation benchmark built on the DISCOVERSE simulator and the AIRBOT-Play robot platform, designed to provide standardized evaluation and training data for multi-stage robot manipulation tasks. The dataset contains three multi-stage tasks of varying difficulty: Block Bridge (74 stages, requiring placing two poles to form a bridge structure and filling with multiple blocks), Stack (18 stages, requiring stacking three colored blocks in order), and Jujube-Cup (19 stages, requiring placing a jujube into a cup and moving the cup to a plate). Each task provides 50 scripted demonstration trajectories, totaling 150 trajectories. Each trajectory includes time-aligned joint state and action data (obs_action.json), as well as video files from two viewpoints (main camera and wrist camera, resolution 448×448, frame rate 20FPS). Additionally, the dataset provides task-aligned normalization statistics (including mean, standard deviation, minimum, maximum, 1st and 99th percentiles, and joint mask) to support cross-task training, and a stage dictionary generated by Gemini-2.5-Pro, with each stage containing positive, negative, and hard negative text descriptions. The dataset is suitable for long-horizon manipulation policy learning, cross-task generalization research, and benchmarking of multi-stage robot manipulation tasks.
数据集概述
基本信息
- 数据集名称: Discoverse-L
- 发布机构: 北京大学计算机学院唐浩团队与北京智源人工智能研究院(BAAI)联合研究
- 关联论文: 《EvoVLA: Self-Evolving Vision-Language-Action Model》
- 论文作者: Zeting Liu*, Zida Yang*, Zeyu Zhang*†, Hao Tang‡
数据集简介
Discoverse-L是一个基于DISCOVERSE模拟器与AIRBOT-Play机器人平台构建的长时程操作基准数据集,主要用于视觉-语言-动作模型的相关研究与评估。
核心内容
1. 任务设计
数据集包含3个多阶段操作任务,难度各异:
- Block Bridge(积木桥):包含74个阶段,需放置两根横条构成桥结构,并填充多个积木
- Stack(叠放):包含18个阶段,需依次叠放三个彩色积木
- Jujube-Cup(枣杯):包含19个阶段,需将枣放入杯中并将杯子移至盘上
2. 数据规模
- 每个任务包含50条脚本化演示轨迹,总计150条轨迹
- 提供任务对齐的归一化统计量,以支持跨任务训练
- 提供阶段词典,包含由Gemini生成的三元组文本描述(正向、负向、难负向)
数据目录结构
Discoverse-L/ ├── demonstrations/ # 演示轨迹数据 │ ├── block_bridge_place/ # 积木桥任务(50个episode) │ ├── place_jujube_coffeecup/ # 枣杯任务(50个episode) │ └── stack_block/ # 叠放任务(50个episode) ├── metadata/ │ └── task_aligned_normalization.json # 各任务归一化统计量 └── stage_dictionaries/ # 各任务阶段词典
数据格式说明
演示轨迹(Demonstration Trajectories)
每个episode目录包含:
- obs_action.json: 时间对齐的观测与动作数据
time: 时间戳序列obs.jq: 7维关节位置观测序列act: 7维关节动作序列
- cam_0.mp4: 448×448主摄像头视角视频(20 FPS)
- cam_1.mp4: 448×448腕部摄像头视角视频(20 FPS)
任务对齐归一化统计
基于每个任务的50条演示计算得出,包含每个任务的7维动作统计数据:
mean、std:均值与标准差min、max:最小值与最大值q01、q99:第1百分位与第99百分位数mask:布尔掩码,标识连续关节(True)与夹爪(False)
阶段词典
由Gemini-2.5-Pro为每个阶段生成文本三元组,每个阶段包含:
id: 阶段编号positive: 正向文本描述negative: 负向文本描述hard_negative: 难负向文本描述




