遇见数据集

Kaikaku/aegis-rollouts

收藏
Hugging Face2026-06-13 更新2026-06-14 收录
官方服务:

资源简介:

该数据集是论文AEGIS: A Backup Reflex for Physical AI: Calling a Stronger Policy Before Long-Horizon Failures Compound的配套滚动日志数据,用于重现论文中的确认性表格和图形。数据集主要包括两个部分:一是确认性因子实验数据,包含10,273个每集NPZ摘要,覆盖LIBERO-Spatial任务的10×70任务×种子公共随机数网格,按完成工作者组织,文件包含任务ID、种子、臂代码、步骤数、成功标志、奖励总和、升级块数、强策略步骤数、强策略步骤比例等关键信息;二是探针评估滚动数据,包含弱策略(SmolVLA 450M)LIBERO-Spatial滚动数据,用于评估早期预警探针,包括每步层-15动作专家特征、廉价补充信号和每步轨迹比例等。数据集还包含分析脚本、JSON结果文件(如确认性对比、探针AUROC、臂结果等)和预注册文档。数据支持机器人学、视觉语言动作、故障预测和运行时可靠性研究,规模在10K到100K之间。

This dataset contains rollout logs for the paper AEGIS: A Backup Reflex for Physical AI: Calling a Stronger Policy Before Long-Horizon Failures Compound, used to reproduce the papers confirmatory tables and figures. It includes two main parts: first, confirmatory factorial data with 10,273 per-episode NPZ summaries across a 10×70 task×seed common-random-number grid for LIBERO-Spatial, organized by completion worker, with keys such as task_id, seed, arm_code, n_steps, success, rewards_sum, chunks_escalated, n_strong_steps, and frac_steps_strong; second, probe evaluation rollout data (n=112) from weak-policy (SmolVLA 450M) LIBERO-Spatial rollouts, featuring per-step layer-15 action-expert features, cheap complement signals, and per-step frac_traj. The dataset also includes analysis scripts, JSON result files (e.g., confirmatory contrasts, probe AUROC, arm results), and pre-registration documentation. It supports robotics, vision-language-action, failure-prediction, and runtime-reliability tasks, with a size category of 10K<n<100K.

提供机构:
Kaikaku
搜集汇总
数据集介绍
Kaikaku/aegis-rollouts 数据集图片
构建方式
该数据集源自论文“AEGIS: A Backup Reflex for Physical AI”,旨在验证一种在长时域任务中当弱策略即将失效时主动召唤强策略的反射机制。数据集构建基于LIBERO-Spatial仿真环境,采用共随机数网格设计,涵盖10个任务×70个种子,共700个独立单元。每个单元在相同初始状态下,执行弱策略独行(A组)、AEGIS靶向触发(B组)、预算匹配的盲触发(C组)、随机触发(D组)、全程强策略、HELM回退及GR00T N1.7泛化等控制臂。所有轨迹以NPZ格式存储,包含任务标识、种子、臂编码、步数、成功率、累加奖励及升级预算使用情况等关键字段。
使用方法
研究者可直接加载NPZ文件中的回合摘要数据进行恢复率、配对McNemar检验及伤害核算等确认性分析。利用提供的探针头权重文件与弱策略回滚数据中的探针特征,可重现早期预警AUROC评分。数据集还附带完整的分析脚本,支持直接生成论文中的表格与图形。对于需在长时域任务中部署鲁棒策略的研发者,该数据集的共随机数结构允许通过重新采样稳健性分析验证结论的稳定性。所有数据及代码均以CC-BY-4.0许可开放,便于学术使用与扩展。
背景与挑战
背景概述
在机器人学习领域,长时域任务中弱策略的失败累积是制约系统可靠性的关键瓶颈。为此,Josef Chen等人于2026年提出AEGIS框架,该数据集作为其实证核心,由KAIKAKU机构主导创建,旨在验证一种成本可控的备份反射机制——通过早期预警探针(AUROC 0.764)动态调用强策略,避免长程任务失败蔓延。基于LIBERO-Spatial仿真环境,该数据集采用共随机数设计,系统采集了10,273条回合级轨迹,覆盖10组任务与70组随机种子,形成弱策略(SmolVLA 450M)、AEGIS定向调用、预算匹配盲调用等七组对照臂。其预注册文档(PRE_REGISTRATION.md)在数据生成前即冻结,确保分析框架的客观性。该工作对智能体运行时可靠性评估与自适应推理策略的研究具有方法学推动意义。
当前挑战
该数据集解决的核心挑战在于:机器人长时域任务中,弱策略失败后强策略补救窗口极窄,而持续调用强策略会产生不可接受的推理成本。AEGIS通过实时探针(基于action-expert layer-15的720维特征)在聚合失败前预测轨迹终态,实现了精准的差异化调用。构建过程中的挑战包括:1)探针特征源的定位错误——初始误接视觉编码器的冻结缓存特征导致AUROC仅0.50,最终修正为动作专家的实时自注意力输出投影;2)仿真套件的适配筛选——在LIBERO-Long等套件中因失败率窗口不匹配(强策略修复空间不足)而转用LIBERO-Spatial;3)动作块粒度从预注册的50步调整为10步,以匹配策略原生输出粒度,需在保持估计量不变的前提下调整实验参数。
常用场景
经典使用场景
在机器人学与具身智能的交叉领域中,长时域任务下的策略失败预测与运行时可靠性提升是核心挑战之一。AEGIS-rollouts数据集专为验证“备份反射”机制而构建,其经典使用场景在于通过大规模析因实验(10任务×70种子×8臂,共计逾万次轨迹)评估一种混合型分层策略——当弱策略(如SmolVLA 450M)在任务执行中面临高风险时,系统能够精确触发更强策略(如GR00T N1.7)进行干预。每份NPZ文件记录了完整的回合级结果,包括成功标志、奖励累加、升级步数及占空比等关键指标,同时通过公共随机数确保各臂之间轨迹水平的严格配对,从而支撑起对干预效果的无偏统计推断。
解决学术问题
该数据集精准回应了长时域机器人操作中一个长期悬而未决的学术命题:如何在计算预算约束下,实时识别并阻止弱策略失败累积效应,同时避免过度依赖昂贵强策略。通过对比靶向干预(AEGIS)、预算匹配盲干预、随机触发及始终使用强策略等多种基线,AEGIS-rollouts以确证性统计框架(McNemar检验、Holm校正、Bootstrap置信区间)首次量化了“适时调用强策略”相较于无差别增强或随机触发的显著优势——在弱策略失败池(646次试验)中,靶向干预恢复了10.1%的任务成功率,是盲干预(4.6%)与随机触发(5.1%)的两倍以上。此举为运行时容错与自适应资源分配提供了可复现的因果证据范式。
实际应用
在实际工业部署中,该数据集直接服务于物理AI系统的安全性与经济性权衡。例如,在仓储分拣、家庭服务或手术辅助等需要连续多步操作的场景中,机器人通常面临计算功耗限制与实时性要求。AEGIS-rollouts所验证的“轻量级探针+条件调用”架构,使得设备能够在仅依赖低算力弱策略完成大部分任务的前提下,精准识别出即将发生失败的关键步骤,并仅在必要时激活云端或本地的高强度模型进行纠偏。这种按需升级策略将强策略的使用比例从100%降至约10%至15%,显著降低了延迟成本与能耗,同时将任务成功率从约33%提升至接近强策略的95%上限,为资源敏感型机器人系统提供了可落地的可靠性解决方案。
数据集最近研究
最新研究方向
在具身智能与机器人学习领域,长时域任务中的级联故障预测与运行时可靠性提升正成为关键挑战。AEGIS-rollouts数据集围绕《AEGIS: A Backup Reflex for Physical AI》论文的核心实验展开,通过大规模确认性析因设计,系统评估了基于早期预警探针的备份反射机制在LIBERO-Spatial基准上的效能。该数据集包含超过一万条逐回合NPZ摘要,覆盖弱策略、AEGIS定向干预、预算匹配盲触发等多种对照臂,并采用公共随机数确保回合级配对。其前沿意义在于:一是首次在机器人操作任务中构建了故障预测驱动的动态策略回退框架,将早期警告探针的AUROC提升至0.764;二是通过预注册的严格统计检验(配对McNemar检验、Holm校正)验证了AEGIS在弱策略故障池中实现约10.1%任务恢复率,显著优于盲触发变体;三是为可复现的运行时可靠性研究提供了标准化数据与代码管线,推动物理AI系统从开环执行向具备故障感知的自主决策范式演进。该工作已被arXiv收录,相关模型与交互演示已开源,对后续机器人长时域自主系统的鲁棒性设计具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务