InternRobotics/VLAC-Cut-Benchmark
收藏官方服务:
资源简介:
Video Progress Benchmark(VPB)是一个用于评估机器人操作中过程级任务进度估计的基准。它旨在衡量模型是否能够捕捉执行视频中的进展、停滞、回归和恢复。VPB基于Progress Annotation Dataset的保留部分构建,与仅关注终点的评估不同,它专注于时间任务进度,并支持分析部分完成、临时失败和后续恢复。该基准包含官方划分的视频存档和预处理、推理及评估代码,用于机器人操纵任务的进度建模研究。
The Video Progress Benchmark (VPB) evaluates process-level task progress estimation for robot manipulation. It measures whether a model can capture advancement, stagnation, regression, and recovery throughout an execution video. VPB is built from the held-out portion of the Progress Annotation Dataset. Unlike endpoint-only evaluations, VPB focuses on temporal task progress and supports analysis of partial completion, temporary failure, and subsequent recovery.
提供机构:
InternRobotics搜集汇总
数据集介绍

构建方式
VLAC-Cut-Benchmark,亦称为Video Progress Benchmark (VPB),源自Progress Annotation Dataset中保留的独立子集,专为评估机器人操作过程中的任务进度感知能力而设计。该基准测试从大规模注释库中精心筛选,将完整的35,230条记录缩减为28,167条经过精炼的训练与评估记录。其构建策略围绕两个核心维度展开:语义任务单元是否出现在训练集中,以及注释轨迹是否包含回归性进度转换。由此衍生出五个官方划分——训练集与四个测试子集(专家可见/未见、非专家可见/未见),确保所有来自同一物理执行的视角归属于同一划分,从而避免数据泄露。
特点
VPB的核心特色在于其超越传统端点评估的时序任务进度分析能力。基准测试不仅衡量模型能否捕捉执行视频中的进展、停滞、退步与恢复,还通过局部方向指标评估相邻语义事件顺序的正确性,区分改进或退步方向。其评估协议采用分段线性插值将注释语义关键帧转换为规范参考轨迹,并以1 Hz标准网格计算全局指标(MAE、PRC、VOC)与终端状态指标(TSA、F1精度)。这种多维度、精细化的评估体系,使VPB能揭示模型在部分完成、临时失败及后续恢复等复杂场景下的表现。
使用方法
使用VPB需首先从HuggingFace仓库下载包含划分文件与视频档案的数据集。划分文件以JSON列表格式记录每条轨迹的ID、任务元数据、帧索引、密集进度值及语义锚点,其中帧路径采用可移植的前缀‘__VLAC2_FRAMES_ROOT__’,需解析为绝对路径。评估时需克隆GitHub代码库(git clone https://github.com/InternRobotics/VLAC-cut),通过运行evaluate_vpb_predictions.py脚本并指定基准路径、预测结果文件及输出路径,即可获得全局、终端与局部方向指标的全面评估报告。
背景与挑战
背景概述
在机器人操作领域,对执行过程中进程级任务进展的精准评估是实现自主决策与技能学习的关键瓶颈。现有评估体系多聚焦于终端状态或静态任务完成度,难以捕捉执行过程中的进展、停滞、退步与恢复等动态时序特征。为此,InternRobotics团队于2026年提出视频进展基准(Video Progress Benchmark, VPB),该数据集由35230条记录与26615个执行片段构成,覆盖15206项操作任务及464446个关键帧进展点,旨在全面衡量模型对时间序列任务进展的感知能力。VPB的发布为具身智能领域的奖励建模、进程估计与鲁棒性分析提供了标准化评估平台,显著推动了机器人学习从终点导向向过程导向的范式转变。
当前挑战
VPB所应对的核心挑战在于传统终端评估无法刻画任务执行中的动态进程变化,如部分完成、临时失败与后续恢复等复杂时序模式,这限制了机器人对操作过程的精细理解与自适应调整能力。在数据集构建过程中,团队面临多维度困难:需对15206项不同任务进行密集的关键帧语义标注,且需统一不同操作者的行为风格差异;同时,为构建可反映真实物理执行状态的参考轨迹,需设计不假设线性变化的插值协议,并解决训练集与测试集间任务单元重叠与轨迹拆分带来的泛化性评估难题。此外,非专家与专家操作轨迹在进展模式上的显著差异,为构建鲁棒的进程估计模型增添了额外挑战。
常用场景
经典使用场景
在具身智能与机器人操作领域,Video Progress Benchmark(VPB)被广泛用于评估模型对操作视频中任务进程的细粒度感知能力。其核心设计聚焦于过程级进度估计,要求模型能够准确捕捉执行视频中的进展、停滞、倒退与恢复等动态状态变化。通过将语义关键帧转换为分段线性插值参考轨迹,VPB支持对部分完成、临时失败及后续恢复等复杂场景的系统性分析。这一基准特别适用于衡量视觉语言模型在未见过任务或非专家演示上的泛化能力,为机器人操作技能的自动化评估提供了标准化工具。
解决学术问题
VPB精准回应当前具身智能研究中一个关键瓶颈:如何从视频中定量评估任务执行的进度状态,而非仅判断最终结果。传统端点式评价难以揭示中途失败、恢复或效率问题,而VPB通过全局轨迹、终端状态与局部方向三类指标,系统性地刻画了进度估计的准确性、排序合理性与方向判别能力。该基准的提出,使得研究者能够科学地比较不同模型在时间逻辑推理、进程状态理解等方面的表现,推动了从简单任务成功率到细粒度过程理解的范式转变,对奖励建模、失败检测与策略优化等方向具有深远影响。
衍生相关工作
VPB的发布催生了一系列相关研究工作。其母公司HELP框架利用进度标注进行高效机器人后训练,展示了将进程理解融入预训练模型的可能路径。基于VPB的评估协议,研究者进一步发展了进度感知的奖励模型,将局部方向指标AP+与AP−用于逆强化学习中的阶段性奖励塑造。此外,该基准中Expert Seen与Unseen的划分设计,为评估模型在新任务上的零样本进度估计能力提供了标准范式,启发了后续关于任务条件化进度预测与跨域泛化的工作。其配套的代码仓库也促进了可重复研究的生态建设,推动了过程级进度评估方法论的系统化发展。
以上内容由遇见数据集搜集并总结生成



