遇见数据集

Discoverse-L

收藏
Hugging Face2026-09-03 更新2026-09-04 收录
官方服务:

资源简介:

Discoverse-L是一个基于DISCOVERSE模拟器和AIRBOT-Play机器人平台构建的长时域操作基准,旨在为多阶段机器人操作任务提供标准化评估和训练数据。该数据集包含三个不同难度的多阶段任务:Block Bridge(74个阶段,需放置两个杆形成桥梁结构并填充多个方块)、Stack(18个阶段,需按顺序堆叠三个彩色方块)和Jujube-Cup(19个阶段,需将一颗枣放入杯子并将杯子移动到盘子上)。每个任务提供50条脚本化演示轨迹,总计150条轨迹。每条轨迹包含时间对齐的关节状态和动作数据(obs_action.json),以及两个视角的视频文件(主摄像头和腕部摄像头,分辨率448×448,帧率20FPS)。此外,数据集提供了任务对齐的归一化统计量(包括均值、标准差、最小值、最大值、第1和第99百分位数及关节掩码)以支持跨任务训练,以及由Gemini-2.5-Pro生成的阶段字典,每个阶段包含正例、负例和难负例文本描述。该数据集适用于长时域操作策略学习、跨任务泛化研究以及多阶段机器人操作任务的基准测试。

Discoverse-L is a long-horizon manipulation benchmark built on the DISCOVERSE simulator and the AIRBOT-Play robot platform, designed to provide standardized evaluation and training data for multi-stage robot manipulation tasks. The dataset contains three multi-stage tasks of varying difficulty: Block Bridge (74 stages, requiring placing two poles to form a bridge structure and filling with multiple blocks), Stack (18 stages, requiring stacking three colored blocks in order), and Jujube-Cup (19 stages, requiring placing a jujube into a cup and moving the cup to a plate). Each task provides 50 scripted demonstration trajectories, totaling 150 trajectories. Each trajectory includes time-aligned joint state and action data (obs_action.json), as well as video files from two viewpoints (main camera and wrist camera, resolution 448×448, frame rate 20FPS). Additionally, the dataset provides task-aligned normalization statistics (including mean, standard deviation, minimum, maximum, 1st and 99th percentiles, and joint mask) to support cross-task training, and a stage dictionary generated by Gemini-2.5-Pro, with each stage containing positive, negative, and hard negative text descriptions. The dataset is suitable for long-horizon manipulation policy learning, cross-task generalization research, and benchmarking of multi-stage robot manipulation tasks.

创建时间:
2026-09-03
原始信息汇总

数据集概述

基本信息

  • 数据集名称: Discoverse-L
  • 发布机构: 北京大学计算机学院唐浩团队与北京智源人工智能研究院(BAAI)联合研究
  • 关联论文: 《EvoVLA: Self-Evolving Vision-Language-Action Model》
  • 论文作者: Zeting Liu*, Zida Yang*, Zeyu Zhang*†, Hao Tang‡

数据集简介

Discoverse-L是一个基于DISCOVERSE模拟器与AIRBOT-Play机器人平台构建的长时程操作基准数据集,主要用于视觉-语言-动作模型的相关研究与评估。

核心内容

1. 任务设计

数据集包含3个多阶段操作任务,难度各异:

  • Block Bridge(积木桥):包含74个阶段,需放置两根横条构成桥结构,并填充多个积木
  • Stack(叠放):包含18个阶段,需依次叠放三个彩色积木
  • Jujube-Cup(枣杯):包含19个阶段,需将枣放入杯中并将杯子移至盘上

2. 数据规模

  • 每个任务包含50条脚本化演示轨迹,总计150条轨迹
  • 提供任务对齐的归一化统计量,以支持跨任务训练
  • 提供阶段词典,包含由Gemini生成的三元组文本描述(正向、负向、难负向)

数据目录结构

Discoverse-L/ ├── demonstrations/ # 演示轨迹数据 │ ├── block_bridge_place/ # 积木桥任务(50个episode) │ ├── place_jujube_coffeecup/ # 枣杯任务(50个episode) │ └── stack_block/ # 叠放任务(50个episode) ├── metadata/ │ └── task_aligned_normalization.json # 各任务归一化统计量 └── stage_dictionaries/ # 各任务阶段词典

数据格式说明

演示轨迹(Demonstration Trajectories)

每个episode目录包含:

  • obs_action.json: 时间对齐的观测与动作数据
    • time: 时间戳序列
    • obs.jq: 7维关节位置观测序列
    • act: 7维关节动作序列
  • cam_0.mp4: 448×448主摄像头视角视频(20 FPS)
  • cam_1.mp4: 448×448腕部摄像头视角视频(20 FPS)

任务对齐归一化统计

基于每个任务的50条演示计算得出,包含每个任务的7维动作统计数据:

  • meanstd:均值与标准差
  • minmax:最小值与最大值
  • q01q99:第1百分位与第99百分位数
  • mask:布尔掩码,标识连续关节(True)与夹爪(False)

阶段词典

由Gemini-2.5-Pro为每个阶段生成文本三元组,每个阶段包含:

  • id: 阶段编号
  • positive: 正向文本描述
  • negative: 负向文本描述
  • hard_negative: 难负向文本描述
搜集汇总
数据集介绍
Discoverse-L 数据集图片
构建方式
Discoverse-L基准数据集植根于DISCOVERSE仿真平台与AIRBOT-Play机器人平台,旨在推动长时程操作任务的研究。其构建过程精心设计了三个难度递进的多阶段操作任务,涵盖74阶段的Block Bridge、18阶段的Stack及19阶段的Jujube-Cup,每个任务均收录了50条由脚本生成的示范轨迹,总计150条。每条轨迹包含时间对齐的关节状态与动作数据,以及主相机与腕部相机的448×448分辨率视频流。此外,数据集通过任务对齐的归一化统计量(如均值、标准差、百分位数)支持跨任务训练,并利用Gemini-2.5-Pro生成阶段字典,提供正例、负例及难负例文本描述,为多模态学习提供了丰富的语义监督信号。
特点
该数据集的核心特色在于其精心设计的多阶段任务结构与层次化语义标注。每个任务被拆分为细粒度的操作阶段,并配有自动生成的文本三元组,精准刻画了各阶段中的正性、负性与难负性状态,从而能够有效引导模型学习细粒度的操作语义。此外,数据集内置了任务对齐的归一化参数,针对不同任务的机械臂关节特征(如连续关节与夹爪二值动作)进行了差异化的统计处理,促进了跨任务的知识迁移与泛化。视频数据双视角采集(主视角与腕部视角)为视觉-语言-动作模型提供了丰富的空间线索,而50条示范轨迹的规模虽精简,却结合阶段字典的密集标注,展现出在样本效率与复杂性考量上的精巧平衡。
使用方法
Discoverse-L数据集适用于训练与评估长时程操作策略,特别是基于视觉-语言-动作模型(如EvoVLA)的端到端学习。使用时,研究者可加载obs_action.json中的关节序列作为状态与动作真值,并解析cam_0.mp4与cam_1.mp4视频流以获取视觉观测。借助metadata中的task_aligned_normalization.json,用户能对动作空间进行标准化处理,其中mask字段指示哪些维度需归一化(连续关节)而哪些需保留原始语义(夹爪)。stage_dictionaries中的阶段字典文件提供了文本描述,可用于构建跨模态对比学习或奖励塑形信号。建议在仿真环境中复现数据集交互流程,或将其作为预训练数据,结合少量真实世界微调,以适应下游操作任务。
背景与挑战
背景概述
在机器人学习领域,长期操作任务(Long-Horizon Manipulation)因其多阶段决策和累积误差问题而成为具身智能研究的前沿挑战。Discoverse-L数据集由北京大学Zeting Liu、Zida Yang、Zeyu Zhang等研究人员于2024年创建,基于DISCOVERSE模拟器与AIRBOT-Play机器人平台,旨在支撑视觉-语言-动作(VLA)模型的自我进化训练。该数据集精心设计了Block Bridge(74阶段)、Stack(18阶段)和Jujube-Cup(19阶段)三种难度递进的多阶段操作任务,并配套150条脚本化演示轨迹、任务对齐的归一化统计量以及由Gemini-2.5-Pro生成的分阶段文本三元组(正例、负例、难负例),为跨任务学习与语言条件操作提供了基准。作为EvoVLA模型的核心训练与评估资源,Discoverse-L填补了多阶段操作模拟数据在细粒度语言-动作对齐方面的空白,对机器人操作泛化性研究具有显著促进作用。
当前挑战
Discoverse-L所应对的核心领域挑战在于长期操作任务中复杂子任务顺序执行与错误累积的难题,这要求策略具备精细的阶段识别与鲁棒的状态切换能力。构建该数据集时,主要挑战包括:其一,设计涵盖74个阶段的Block Bridge任务,需确保每个阶段的物理可行性与视觉可区分性,协调多物体间的局部交互;其二,利用脚本化方式生成150条高质量演示轨迹,同时需维持动作的平滑性与策略多样性,以避免模仿学习中的分布偏移;其三,Gemini-2.5-Pro生成的分阶段文本三元组需精准捕捉视觉状态间的细微语义差异(如接近目标与接近干扰物的区分),这对文本与视觉模态的细粒度对齐提出了极高要求。此外,任务对齐归一化统计量的计算需妥善处理不同任务间的关节维度差异与夹爪离散性,确保跨任务训练的稳定性与迁移性能。
常用场景
经典使用场景
Discoverse-L作为长时程操作任务基准,专为评估和提升视觉-语言-动作(VLA)模型在多阶段、多对象操作场景中的表现而设计。其核心应用在于对模型进行长时程规划与执行能力的标准化测试,通过Block Bridge(74阶段)、Stack(18阶段)和Jujube-Cup(19阶段)等任务,检验模型在复杂空间推理、序列决策和精细操控方面的综合性能。该基准提供统一的演示轨迹、任务对齐的归一化统计量及阶段字典,使得不同VLA模型能够在相同条件下进行公平比较,推动该领域从短时单步操作向长时程多阶段泛化的研究演进。
实际应用
在实际应用中,Discoverse-L所模拟的装配、堆叠和物品放置任务直接映射至工业自动化中的精密组装、仓储拣选和餐饮服务等场景。例如,Block Bridge任务对应多部件结构搭建,Stack任务反映颜色分类堆叠操作,Jujube-Cup则涉及对易变形物体的灵巧操作。这些能力对机器人执行长期复杂作业至关重要,如集成生产线上的零件组装、物流分拣中的多步骤打包、以及医疗护理中的物品递送等。该数据集作为仿真训练场,使模型在安全可控环境中习得长时程策略,经过域随机化等手段的提升,可迁移至真实机器人平台(如AIRBOT-Play),加速从实验室原型到商业部署的转化,有效降低真实世界数据采集的风险与成本。
衍生相关工作
基于Discoverse-L基准,衍生了多项影响深远的工作。其关联论文《EvoVLA: Self-Evolving Vision-Language-Action Model》提出了自进化训练范式的VLA模型,利用该基准的长时程任务链进行在线策略迭代,显著提升模型在未见任务中的泛化能力。此外,该数据集为后续研究提供了基线,推动了多任务学习、数据增强及基于大语言模型的阶段规划等方向的发展。研究者也借鉴其阶段字典设计,生成更丰富的语言监督信号,用于改进跨任务对齐和少样本学习。Discoverse-L已成长为长时程操作实验的验证依据,系列延伸研究不仅验证了自身基准的有效性,还启发后续大型操作基准的构建,为机器人在复杂环境中的长期自主学习奠定了夯实基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务