遇见数据集

ConfAL-WM-Dataset

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

ConfAL-WM 数据集是 ConfAL-WM(置信度引导的主动学习用于动作条件世界模型)项目的评估工件,包含在 RoboTwin2.0 候选池(约 18,000 个片段)上预计算的输出结果。该数据集主要用于支持世界模型的训练、主动学习策略评估以及置信度估计研究。数据集包含多个子集:(1) 50 任务预筛选包,每个任务一个代表性片段,包含预测帧、潜变量、动作、置信度分数、风险地图和 JSON 元数据;(2) EVAC-v2 训练推理包,包含 7298 个由 C3 均值风险采集选中的片段,每个片段有预测帧、潜变量、动作等;(3) 密集置信度/风险输出包,包含 7277 个选中片段的密集置信度地图和风险统计;(4) 基线选择推理结果包,包含其他采集基线(如 GVL、LRMS、PRM-judge、随机等)选中的片段;(5) 基线加权帧级评分数据包,包含帧级评分用于额外加权基线实验;(6) YOLO 标注包,包含机器人臂轨迹(夹爪)的伪标签,格式为 YOLO 检测格式。所有数据均经过路径清洗和匿名化处理,确保无用户或机器信息泄露。该数据集适用于机器人学习、主动学习、置信度估计、世界模型评估等任务。

The ConfAL-WM dataset is the evaluation artifact of the ConfAL-WM (Confidence-guided Active Learning for Action-Conditioned World Models) project, containing precomputed outputs on the RoboTwin2.0 candidate pool (approximately 18,000 episodes). It is primarily used to support world model training, active learning strategy evaluation, and confidence estimation research. The dataset includes multiple subsets: (1) 50-task prescreening package, one representative episode per task, containing predicted frames, latent variables, actions, confidence scores, risk maps, and JSON metadata; (2) EVAC-v2 training inference package, containing 7,298 episodes selected by C3 mean risk acquisition, each with predicted frames, latent variables, actions, etc.; (3) Dense confidence/risk output package, containing dense confidence maps and risk statistics for 7,277 selected episodes; (4) Baseline selection inference results package, containing episodes selected by other acquisition baselines (e.g., GVL, LRMS, PRM-judge, random); (5) Baseline weighted frame-level scoring data package, containing frame-level scores for additional weighted baseline experiments; (6) YOLO annotation package, containing pseudo-labels for robot arm trajectories (grippers) in YOLO detection format. All data have been path-cleaned and anonymized to ensure no leakage of user or machine information. The dataset is suitable for tasks such as robot learning, active learning, confidence estimation, and world model evaluation.

创建时间:
2026-08-17
原始信息汇总

ConfAL-WM 数据集概述

ConfAL-WM: Confidence-Guided Active Learning for Action-Conditioned World Models(匿名投稿)的配套数据与评估产物,与项目主页“07 · Models & Data”部分对应。数据集提供预计算推理结果,避免对 RoboTwin2.0 候选池(约 18k 条轨迹)进行重复昂贵推理。

许可证与标签

  • 许可证: Apache-2.0
  • 标签: world-model, active-learning, confidence-estimation, robot-learning, robotwin

数据包内容

  1. 50-task prescreen package/
    50 个任务的预筛选包(每任务一个代表性轨迹),包含 EVAC-v1 推理结果、置信度分数、风险图及 JSON 元数据。内含 task_prescreen_package.tartask_prescreen_summary.json

  2. EVAC-v2 training - inference/
    C3 均值风险采集选中的全部轨迹(7298 条,覆盖权重变体并集)的预计算 EVAC-v1 推理输出。按任务分片(50 个 tar),含预测帧、潜变量、动作及元数据,并附 none_selection_summary.json

  3. EVAC-v2 training - dense confidence/
    同一批选中轨迹(7277 条,剩余 21 条预筛选代表在预筛选包中评分)的密集置信度/风险输出,用于置信度引导重训练(帧/帧+块加权)。含 c3_mean_risk_selected_scores.tar 和选择概览 JSON。

  4. Baseline selection - v1 inference results/
    其他采集基线(GVL、LRMS、PRM-judge、random、RoboMeter-pref、RoboMeter-prog、RoboReward,均使用均值风险聚合)选中的轨迹的 EVAC-v1 推理输出,排除已在 C3 包中的轨迹。每基线一个 tar 包和对应选择概览 JSON。

  5. Baseline weighting - v2 frame-scoring data/
    附加权重基线实验的帧级评分产物,包含 baseline_weighting_v2_frame_scoring.tar(含 lrms/、prm_judge/、robometer_pref/、robometer_prog/ 目录及 JSONL/JSON 文件)。

  6. YOLO RoboTwin2.0 annotations/
    根据 RoboTwin2.0 动作条件估计的机械臂夹爪轨迹标签(YOLO 检测格式)。含 yolo_annotations.tar(标签、data.yaml、清单、投影报告及可视化文件)。注意:源图像(94 GB)未重新分发,需将 data.yaml 指向本地 RoboTwin2.0 帧。

  7. Evaluation tables and bootstrap JSON/
    pooled_mean_risk_episode_level.json,提供均值/逐种子指标及轨迹级均值风险比较的合并配对 bootstrap 统计。

规范与匿名化

  • tar 归档未压缩(tar -x 解压),每 RoboTwin 任务一个分片。
  • 所有 JSON/YAML/CSV 均经过路径清理:绝对路径替换为仓库相对路径或 <DATA_ROOT>/… 占位符,无用户名、主机名或机器特定路径残留,数值数组和图像保持不变。
  • 轨迹 ID 遵循 RoboTwin2.0 格式(<task>_aloha-agilex_randomized_500_epNNN),可通过 <DATA_ROOT> 路径从公开 RoboTwin2.0 发布中恢复原始轨迹。

配套资源

  • 配套模型检查点:anonymous89793/ConfAL-WM 模型仓库。

数据集地址:https://huggingface.co/datasets/anonymous89793/ConfAL-WM-Dataset

搜集汇总
数据集介绍
ConfAL-WM-Dataset 数据集图片
构建方式
该数据集为ConfAL-WM框架的配套评估工件,通过预计算的推理输出与置信度评分,构建了面向动作条件世界模型的主动学习基准。其构建过程基于RoboTwin2.0候选池(约1.8万条轨迹),采用EVAC-v1模型对50项任务预筛(每项一条代表性轨迹),并利用C3均值风险采集策略,在多种加权变体下筛选出7298条用于EVAC-v2训练的子集。此外,数据集还包含了基于其他采集基线(如GVL、LRMS等)所选样本的推理结果,以及用于加权基线实验的帧级评分数据。对于YOLO标注部分,则依据RoboTwin2.0的动作条件,利用机器人手臂轨迹估计生成夹爪标签,并以YOLO检测格式存储,原始图像因体量庞大未被重分发,仅提供标注文件与配置指南。所有档案均经过路径清洗与匿名化处理,确保不泄露用户信息。
特点
该数据集的一大显著特征在于其系统性地整合了多种主动学习采集策略的评估产物,涵盖了从预筛到训练再至评估的全流程数据。具体而言,它既包含了EVAC-v1在50任务预筛中的预测帧、潜变量、动作及置信度风险图,也提供了EVAC-v2训练所选样本的密集置信度输出,并针对每一类基线方法单独存放了选择摘要与评分分布。这种精细的模块化封装使得研究者可以便捷地对比不同采集策略的效能,而无需重复昂贵的推理计算。此外,YOLO标注部分采用伪标签生成途径,通过投影报告与可视化文件辅助验证标注质量,同时中央池中的每一条轨迹均可追溯至公开的RoboTwin2.0发布,保证了数据来源的透明性与可复现性。所有档案均以未压缩的tar包形式按任务分片,便于高效管理与局部调用。
使用方法
在使用该数据集时,研究者可通过解压各tar包获取所需的推理结果与统计信息。例如,可直接将`c3_mean_risk_selected_scores`目录下的置信度图(conf_map.npy)与风险统计(risk_stats.json)用于置信度引导的重新训练,或依据`none_selection_summary.json`中的选择概述进行采集策略的二次分析。对于YOLO标注部分,需将`data.yaml`中的图像路径指向本地RoboTwin2.0图像数据,再由Ultralytics框架自动重建标签缓存以进行训练或评估。评估表格与bootstrap JSON文件可被直接加载用于生成统计对比图或表的辅助数据。所有路径已标准化为相对路径或`<DATA_ROOT>`占位符,用户仅需替换为实际数据根目录即可无缝衔接至现有工作流。该数据集设计旨在减少重复推理开销,加速世界模型主动学习研究的迭代进程。
背景与挑战
背景概述
ConfAL-WM数据集由匿名研究团队于2024年创建,旨在推动基于置信度引导的主动学习在行动条件世界模型中的应用。该数据集围绕RoboTwin2.0模拟环境中的机器人操作任务,提供了超过7000个精选轨迹的预计算推理结果、密集置信度图及风险统计,并配套了评估表格和YOLO格式的标注。其核心研究问题在于如何通过主动学习策略高效筛选高价值训练样本,以提升世界模型在复杂动态环境下的泛化能力。该数据集填补了主动学习与世界模型交叉领域的空白,为机器人学习社区提供了标准化基准和可复现的评估工具,对后续研究具有重要参考价值。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两方面。在领域层面,行动条件世界模型需应对高维视觉输入的预测不确定性,而主动学习的关键难点在于设计有效的置信度估计方法,以识别模型知识盲区并平衡探索与利用,避免冗余采样。构建过程中,研究者需处理约18k候选轨迹的规模,通过C3均值风险策略筛选7298个代表性子集,并面临多基线比较的工程复杂性,包括不同选择策略(如GVL、LRMS)的集成与去重,以及YOLO标注的生成,其中源图像数据量达94GB,需依赖伪标签和路径清理确保数据一致性与匿名性。
常用场景
经典使用场景
该数据集是面向机器人学习领域中的主动学习与世界模型研究的综合性数据与评估工件集,其核心用途在于为基于置信度引导的主动学习方法在动作条件世界模型上的训练与评估提供便捷的预计算推理输出。具体而言,它涵盖了50任务预筛选阶段、EVAC-v2训练阶段以及多种基线选择与加权策略下的推理结果,包括预测帧、潜在表征、动作序列及置信度得分等关键信息,从而支持研究者直接进行模型的比较与分析,无需重复昂贵的大规模推理过程。
解决学术问题
该数据集有效解决了机器人学习研究中大规模数据筛选与模型评估的重复计算问题,以及主动学习策略在动作条件世界模型上有效性的验证难题。通过提供跨任务、跨基线的统一评估数据和置信度指标,它促进了关于不确定性估计、样本选择策略对世界模型性能影响的系统研究,并为在有限计算资源下开展公平、可复现的主动学习实验提供了基础设施,推动了该领域学术研究的标准化与效率提升。
衍生相关工作
该数据集衍生了一系列基于置信度估计与主动学习策略的机器人世界模型研究工作,其提供的多基线选择结果和密度置信度输出为后续研究设立了比较标准。相关经典工作包括但不限于:基于风险图的不确定性驱动样本选择方法、融合多种评分源的加权训练策略、以及利用伪标注进行视觉检测的辅助任务。这些工作共同推动了主动学习与机器人世界模型交叉领域的深入发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务