遇见数据集

Test-Dataset

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

AXIS held-out 20 是一个跨体现少样本适应基准数据集,用于评估策略在仅提供20个演示的情况下,通过LoRA适应新任务的能力。该基准包含20个在预训练阶段从未见过的操作任务,每个任务提供20个高质量演示(共400个演示),以及对应的评估协议。数据集主要包含规格文件和索引,而非原始演示数据:规格文件(spec/)定义了任务列表、相机配置、评估种子等;索引文件(franka/index/heldout20_index.jsonl)每行对应一个演示,包含任务ID、尝试ID、帧数、帧率、多相机参数(内参和外参)、场景变体、种子等元数据。相机配置是强制性的:腕部相机必须符合LIBERO标准(平移[0.05,0,0]米,四元数[0,0.707108,0.707108,0],垂直FOV 75°),第三相机固定于[0.95,0.0,1.43]米。评估采用50个episode(使用固定种子)和成功率指标,并要求经过可学习性门控(成功率20%-80%)。该基准明确不测量机器人初始状态鲁棒性、视觉鲁棒性,且缺少pick_place、stack、push、pull等任务类型。

AXIS held-out 20 is a cross-embodiment few-shot adaptation benchmark dataset designed to evaluate the ability of a policy to adapt to new tasks using only 20 demonstrations via LoRA. The benchmark includes 20 manipulation tasks never seen during pre-training, each with 20 high-quality demonstrations (400 demonstrations total), along with a corresponding evaluation protocol. The dataset mainly contains specification files and index files rather than raw demonstration data: the spec/ directory defines task lists, camera configurations, evaluation seeds, etc.; the index file (franka/index/heldout20_index.jsonl) contains one line per demonstration, with metadata such as task ID, attempt ID, frame count, frame rate, multi-camera parameters (intrinsics and extrinsics), scene variants, seeds, etc. Camera configuration is mandatory: the wrist camera must conform to the LIBERO standard (translation [0.05,0,0] meters, quaternion [0,0.707108,0.707108,0], vertical FOV 75°), and the third camera is fixed at [0.95,0.0,1.43] meters. Evaluation uses 50 episodes (with fixed seeds) and success rate metrics, with a learnability gate (success rate between 20% and 80%). The benchmark explicitly does not measure robot initial state robustness, visual robustness, and lacks task types such as pick_place, stack, push, pull, etc.

创建时间:
2026-08-20
原始信息汇总

AXIS held-out 20 数据集概述

数据集定位

AXIS held-out 20 是一个跨具身(cross-embodiment)少样本自适应基准测试,包含预训练阶段从未见过的20个任务,每项任务提供20个演示样本,采用LoRA(低秩适配)进行自适应,并通过实际部署(rollout)进行评估。

注意:当前发布的是基准的规格说明与索引文件,并非演示数据本身。任务列表目前处于候选状态,可学习性筛选尚未执行。

评测目标

该基准衡量的是少样本自适应能力(而非泛化能力):策略基于20个未见任务的演示,通过LoRA适配后,在与演示相同条件下进行评估。

维度 演示间是否变化 评估策略
物体身份、位置、抖动 随机变化
机器人初始状态 否(0.22° / 1.8 mm) 固定
相机位姿 固定
外观/光照/纹理 固定

目录结构

spec/ benchmark_spec.json 任务列表、操作、门槛阈值、协议 camera_rig.json 必需的腕部相机配置及实测配置 eval_seeds.json 所有具身必须使用的种子列表 franka/ index/heldout20_index.jsonl 每条演示一行

相机配置(强制规定)

腕部相机(相对末端执行器坐标系):

  • 位置:[0.05, 0, 0] m
  • 四元数:0 0.707108 0.707108 0
  • 垂直视场角:75°

实测与要求的显著差异(仅用于说明,必须复现要求值):

  • 手→相机平移:要求 [0.05, 0, 0],实测 [-0.074, 0, 0.0292],偏差12.7厘米且x方向相反
  • 垂直视场角:要求75°,实测51.87°,窄23.1°

第三视角相机:所有任务与片段统一使用固定位姿 [0.95, 0.0, 1.43]

索引文件说明

  • 连接键task_id + attempt_id(切勿使用episode_index连接)
  • 帧率:15 fps
  • 相机数量:10个(frontview/wrist各加4个随机副本)
  • 内参:适用于640×360源分辨率,其他分辨率需调整
  • join_origin:标记连接来源为published(18个任务)或action_match(2个任务,即任务815和1746,其配对通过轨迹匹配恢复,准确率在任务868上实测为401/401)

评估协议

  • 每任务50个片段,所有具身使用相同的eval_seeds.json种子
  • 评估场景仅变化物体集合/位置/抖动
  • 50次试验下,真实成功率20%对应的95%置信区间约为±11个百分点

可学习性门槛(尚未执行)

每个任务必须以pi05_base+20演示LoRA满足:20% ≤ 成功率 ≤ 80%。此前的10任务版本基准中,6个评估任务里有4个成功率为0/10,因此该门槛旨在剔除无法学习的任务。其中pickplacereachremove各只有1个合格任务,门槛失败无法替补。

已知局限

  • 不评测机器人初始状态鲁棒性(演示起点固定)
  • 不评测视觉鲁棒性(演示中无外观变化)
  • 不包含pick_placestackpushpull任务(数据质量未达标准)

其他内容

本仓库还包含与基准无关的早期AXIS发布:

  • stage1_5k_camera_fixed/:阶段1的5k固定相机语料库及产物
  • 第1轮阶段2的LIBERO构建(2,000片段 / 338,575帧 / 128像素 / LeRobot v3.0)
搜集汇总
数据集介绍
Test-Dataset 数据集图片
构建方式
本数据集是针对跨具身少样本适应任务精心构建的基准测试集,其构建方式严谨而富有层次。它明确界定了20项预训练中未曾出现的操作任务,并为每项任务提供20个示范演示,采用LoRA适配与滚动评估机制。构建过程严格遵循‘具身优先’原则,确保新增具身不会干扰既有具身。数据集的核心规范文件包括benchmark_spec.json(任务列表与协议)、camera_rig.json(强制性腕部相机配置)及eval_seeds.json(统一评估种子),并通过索引文件(heldout20_index.jsonl)记录每个演示的元数据,实现任务与具身的解耦。特别地,相机支架被设定为规定性要求,以消除不同具身之间因相机差异带来的混淆。
使用方法
使用本数据集时,用户需遵循严格的评估协议。首先,根据spec/benchmark_spec.json中的任务列表和协议,使用提供的种子列表生成评估场景,确保跨具身的一致性。用户需依据spec/camera_rig.json中的规定配置腕部相机,并在每次评估中采用50个情节,以统计可靠性。数据集提供了从提示到索引的完整指南,用户可基于自身的具身平台进行渲染和评估,并通过LoRA适配进行少样本学习。对于特定任务(如815和1746),需注意其连接恢复状态。评估时,应关注成功率的置信区间,并参考数据集中声明的已知限制,以合理解释评估结果。
背景与挑战
背景概述
Test-Dataset,作为AXIS项目的一部分,由相关研究机构于近期发布,旨在构建一个跨实体(cross-embodiment)的少样本适应基准。该数据集聚焦于机器人操作领域,其核心研究问题在于:如何在给定少量演示(20个)的情况下,使策略通过LoRA微调快速适应未见过的任务,并保持在不同实体上的可复现性。数据集精心设计了任务规格、相机配置和评估协议,强调在相同条件下评估适应性能,而非泛化能力。其发布对机器人学习社区具有重要意义,为跨实体基准的构建提供了规范化的范例,尤其在固定相机参数、统一评估种子等方面树立了标准,有望推动该领域向更严谨、可比的方向发展。
当前挑战
该数据集面临的挑战多维且显著。首先,在领域问题层面,跨实体少样本适应本身极具挑战性,需要解决不同机器人实体间的形态差异、相机视角差异以及任务变化带来的分布偏移。其次,构建过程中遭遇了具体技术瓶颈:相机配置在实测中与预设标准存在显著偏差(平移12.7厘米,垂直视场角窄23.1°),迫使数据集采用规定性而非冻结的相机设置;两个任务的任务清单与渲染数据不匹配,需通过轨迹匹配法恢复连接。此外,可学习性门槛尚未验证,以往版本曾出现6个任务中4个成功率为0的情况,使得任务筛选成为关键难题。数据集还明确承认了未测量机器人初始状态鲁棒性和视觉鲁棒性等局限,这些因素共同构成了数据集在构建和有效性上的主要挑战。
常用场景
经典使用场景
该数据集作为跨本体少样本适应基准,主要用于评估策略在仅提供20条未见任务演示时,通过LoRA适配后在该任务上的表现。其设计哲学强调测量对目标设置的适应性而非泛化能力,评测条件严格匹配演示中的变化维度,如物体身份和放置位置可变,而机器人初始状态、相机位姿及外观均固定,确保评估的纯净性和可比性。此基准适用于机器人操作领域,特别是多本体迁移场景,为研究跨实体知识迁移提供标准化的评测平台。
解决学术问题
该数据集解决了机器人学习领域中跨本体少样本适应的评测难题,特别是在缺乏统一基准时,不同研究难以公平比较。它通过规定相机支架和评估协议,消除了本体差异对性能评估的混淆,使分数差异可归因于策略而非硬件。其双端门槛(20%至80%成功率)避免了任务过易或过难导致的评测失真,并公开了已知局限,如不评估初始状态鲁棒性,引导研究者明确边界,推动了对少样本适应本质的理解。
实际应用
在实际应用中,该数据集可用于开发机器人快速适应新任务的系统,例如在工业分拣或家庭服务中,机器人通过少量人类演示迅速学习新操作。其跨本体特性支持将策略部署到不同型号的机器人上,减少重新收集数据的成本。评测协议的种子统一性确保不同实验室结果可复现,适合作为产品级机器人解决方案的验证工具,推动从仿真到现实的有效迁移。
数据集最近研究
最新研究方向
该数据集聚焦于跨具身(cross-embodiment)少样本适应基准的构建,旨在评估策略在仅有20条演示的情况下,通过LoRA微调适应新任务的能力。其最新研究方向强调在严格固定相机配置与机器人初始状态的条件下,测量真实适应性能,而非泛化能力,并引入双重门槛(20%-80%成功率)确保任务可学习性。该基准对摄像头布局采取规范性描述,以消除不同机械臂间的视觉混杂因素,推动机器人操作领域在少样本学习与跨平台迁移方面迈向更严谨、可复现的评估范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务