Eval-Actions
收藏资源简介:
Eval-Actions是由北京大学团队构建的机器人操作评估基准数据集,旨在解决当前模仿学习领域评估可信度不足的问题。该数据集包含13,000条轨迹数据,其中创新性地整合了2,800条失败场景数据,覆盖单臂/双臂操作任务,数据来源同时包含人类遥操作和策略生成轨迹。数据集通过专家评分(EG)、排序引导偏好(RG)和思维链(CoT)三重监督信号,对动作平滑度、安全性等细粒度质量维度进行标注。其构建过程采用混合模态采集方案,包含RGB-D传感器数据和文本描述。该数据集主要应用于机器人模仿学习的可信评估领域,可有效诊断策略执行的源真实性和动作质量,为开发安全可靠的部署方案提供基准支持。
Eval-Actions is a robotic manipulation evaluation benchmark dataset developed by the Peking University team, designed to address the insufficient credibility issue in current imitation learning evaluation. This dataset contains 13,000 trajectory samples, among which 2,800 failed scenario trajectories are innovatively integrated, covering both single-arm and dual-arm manipulation tasks. The dataset’s sources include both human teleoperation trajectories and policy-generated trajectories. It annotates fine-grained quality dimensions such as motion smoothness and safety using three types of supervision signals: Expert Rating (EG), Ranking-guided Preference (RG), and Chain-of-Thought (CoT). The dataset is constructed via a hybrid-modal data collection scheme, which incorporates RGB-D sensor data and textual descriptions. Mainly applied in the field of trustworthy evaluation for robotic imitation learning, this dataset can effectively diagnose the source authenticity and motion quality of policy execution, providing benchmark support for the development of safe and reliable robotic deployment solutions.
TERM-Bench 数据集概述
数据集名称
TERM-Bench (Trustworthy Evaluation of Robotic Manipulation)
核心目标
为机器人操作建立可信赖的评估基准,解决当前评估方法在来源真实性和执行质量两个关键信任维度上的不足。
基准构成:Eval-Actions 数据集
- 数据内容:包含视觉-动作(VA)和视觉-语言-动作(VLA)策略执行轨迹、人类遥操作数据,并明确包含失败场景。
- 任务规模:覆盖150多个场景,包括单臂交互和复杂的双手协调任务。
- 数据类型:
- 原始感知数据:RGB、深度(Depth)。
- 精确运动学记录:7/14自由度关节轨迹。
- 细粒度质量雷达图:显式量化四个核心维度(成功度、平滑度、安全性、效率)。
- 监督信号:基于三个核心监督信号构建:
- 专家评分(Expert Grading, EG)
- 排名引导偏好(Rank-Guided preferences, RG)
- 思维链(Chain-of-Thought, CoT)
- 独特之处:与以训练为中心、最大化原始轨迹数量的数据集不同,Eval-Actions 最大化注释密度,独特地提供失败场景、混合轨迹来源和用于诊断评估的细粒度质量评分。
评估框架:AutoEval
一个用于可信赖评估的架构,包含两个分支:
- AutoEval Small (AutoEval-S):
- 针对专家评分和排名引导任务。
- 采用时空聚合策略将高频运动细节压缩为复合视觉标记。
- 通过监督微调(SFT)使用交叉熵损失进行优化。
- AutoEval Plus (AutoEval-P):
- 针对思维链推理任务。
- 采用组相对策略优化(GRPO)范式。
- 通过包含内容准确性和格式约束的混合奖励函数进行优化,以增强物理推理能力。
关键性能指标
- 评估精度:
- 在专家评分协议下,斯皮尔曼等级相关系数(SRCC)达到 0.81。
- 在排名引导协议下,斯皮尔曼等级相关系数(SRCC)达到 0.84。
- 来源鉴别能力:能够以 99.6% 的准确率区分策略生成的视频和遥操作视频。
数据示例与评分分析
数据集包含不同质量等级的示例,并通过思维链分析进行细粒度评分:
- 低质量(得分:2.0):运动犹豫、不流畅,任务失败。
- 中等质量(得分:5.0):运动平稳、受控,任务完成。
- 高质量(得分:9.0):运动速度适中、控制最优,执行完美。
真实性验证分析
能够基于运动学模式区分人类遥操作与策略执行:
- 人类遥操作:运动表现出自然变异和微调,具有典型的人类生物控制特征。
- 策略执行:运动与计算轨迹在数学上一致,关节运动方差低,具有刻意的、非反应性的控制特征。
策略性能排名示例
基于平均得分对策略进行排名:
- π0:平均得分 4.4702
- ACT:平均得分 3.6959
- RDT:平均得分 2.4304

- 1Trustworthy Evaluation of Robotic Manipulation: A New Benchmark and AutoEval Methods北京大学 · 2026年



