Test-Dataset
收藏资源简介:
AXIS held-out 20 是一个跨体现少样本适应基准数据集,用于评估策略在仅提供20个演示的情况下,通过LoRA适应新任务的能力。该基准包含20个在预训练阶段从未见过的操作任务,每个任务提供20个高质量演示(共400个演示),以及对应的评估协议。数据集主要包含规格文件和索引,而非原始演示数据:规格文件(spec/)定义了任务列表、相机配置、评估种子等;索引文件(franka/index/heldout20_index.jsonl)每行对应一个演示,包含任务ID、尝试ID、帧数、帧率、多相机参数(内参和外参)、场景变体、种子等元数据。相机配置是强制性的:腕部相机必须符合LIBERO标准(平移[0.05,0,0]米,四元数[0,0.707108,0.707108,0],垂直FOV 75°),第三相机固定于[0.95,0.0,1.43]米。评估采用50个episode(使用固定种子)和成功率指标,并要求经过可学习性门控(成功率20%-80%)。该基准明确不测量机器人初始状态鲁棒性、视觉鲁棒性,且缺少pick_place、stack、push、pull等任务类型。
AXIS held-out 20 is a cross-embodiment few-shot adaptation benchmark dataset designed to evaluate the ability of a policy to adapt to new tasks using only 20 demonstrations via LoRA. The benchmark includes 20 manipulation tasks never seen during pre-training, each with 20 high-quality demonstrations (400 demonstrations total), along with a corresponding evaluation protocol. The dataset mainly contains specification files and index files rather than raw demonstration data: the spec/ directory defines task lists, camera configurations, evaluation seeds, etc.; the index file (franka/index/heldout20_index.jsonl) contains one line per demonstration, with metadata such as task ID, attempt ID, frame count, frame rate, multi-camera parameters (intrinsics and extrinsics), scene variants, seeds, etc. Camera configuration is mandatory: the wrist camera must conform to the LIBERO standard (translation [0.05,0,0] meters, quaternion [0,0.707108,0.707108,0], vertical FOV 75°), and the third camera is fixed at [0.95,0.0,1.43] meters. Evaluation uses 50 episodes (with fixed seeds) and success rate metrics, with a learnability gate (success rate between 20% and 80%). The benchmark explicitly does not measure robot initial state robustness, visual robustness, and lacks task types such as pick_place, stack, push, pull, etc.
AXIS held-out 20 数据集概述
数据集定位
AXIS held-out 20 是一个跨具身(cross-embodiment)少样本自适应基准测试,包含预训练阶段从未见过的20个任务,每项任务提供20个演示样本,采用LoRA(低秩适配)进行自适应,并通过实际部署(rollout)进行评估。
注意:当前发布的是基准的规格说明与索引文件,并非演示数据本身。任务列表目前处于候选状态,可学习性筛选尚未执行。
评测目标
该基准衡量的是少样本自适应能力(而非泛化能力):策略基于20个未见任务的演示,通过LoRA适配后,在与演示相同条件下进行评估。
| 维度 | 演示间是否变化 | 评估策略 |
|---|---|---|
| 物体身份、位置、抖动 | 是 | 随机变化 |
| 机器人初始状态 | 否(0.22° / 1.8 mm) | 固定 |
| 相机位姿 | 否 | 固定 |
| 外观/光照/纹理 | 否 | 固定 |
目录结构
spec/ benchmark_spec.json 任务列表、操作、门槛阈值、协议 camera_rig.json 必需的腕部相机配置及实测配置 eval_seeds.json 所有具身必须使用的种子列表 franka/ index/heldout20_index.jsonl 每条演示一行
相机配置(强制规定)
腕部相机(相对末端执行器坐标系):
- 位置:
[0.05, 0, 0]m - 四元数:
0 0.707108 0.707108 0 - 垂直视场角:75°
实测与要求的显著差异(仅用于说明,必须复现要求值):
- 手→相机平移:要求
[0.05, 0, 0],实测[-0.074, 0, 0.0292],偏差12.7厘米且x方向相反 - 垂直视场角:要求75°,实测51.87°,窄23.1°
第三视角相机:所有任务与片段统一使用固定位姿 [0.95, 0.0, 1.43]。
索引文件说明
- 连接键:
task_id+attempt_id(切勿使用episode_index连接) - 帧率:15 fps
- 相机数量:10个(
frontview/wrist各加4个随机副本) - 内参:适用于640×360源分辨率,其他分辨率需调整
join_origin:标记连接来源为published(18个任务)或action_match(2个任务,即任务815和1746,其配对通过轨迹匹配恢复,准确率在任务868上实测为401/401)
评估协议
- 每任务50个片段,所有具身使用相同的
eval_seeds.json种子 - 评估场景仅变化物体集合/位置/抖动
- 50次试验下,真实成功率20%对应的95%置信区间约为±11个百分点
可学习性门槛(尚未执行)
每个任务必须以pi05_base+20演示LoRA满足:20% ≤ 成功率 ≤ 80%。此前的10任务版本基准中,6个评估任务里有4个成功率为0/10,因此该门槛旨在剔除无法学习的任务。其中pick、place、reach、remove各只有1个合格任务,门槛失败无法替补。
已知局限
- 不评测机器人初始状态鲁棒性(演示起点固定)
- 不评测视觉鲁棒性(演示中无外观变化)
- 不包含
pick_place、stack、push、pull任务(数据质量未达标准)
其他内容
本仓库还包含与基准无关的早期AXIS发布:
stage1_5k_camera_fixed/:阶段1的5k固定相机语料库及产物- 第1轮阶段2的LIBERO构建(2,000片段 / 338,575帧 / 128像素 / LeRobot v3.0)





