RoboFine-bench
收藏资源简介:
RoboFine-Bench是一个用于评估视觉语言模型对机器人操作视频细粒度理解能力的基准数据集。它旨在检验模型是否能够深入理解机器人执行任务的具体方式,捕捉执行层面的细节。数据集包含500个严格保留的机器人操作视频轨迹,这些视频来自10个开源机器人数据集(如BridgeData-V2、RT-1等),涵盖了32种不同的机械臂形态、多样的相机视角和广泛的操控任务。每个视频轨迹都配备了经过人工审核的、分解到步骤级别的标注,总计形成了10,816个跨十个维度的“原子事实”,平均每个样本包含4.3个步骤和21.6个事实。这十个细粒度维度包括:动作序列、执行主体(主动臂)、目标物体、初始配置、最终配置、接触与接近方式、轨迹与朝向、身体运动、物体交互以及失败与恢复。所有基准轨迹均与训练集(47,159个样本)严格不重叠,确保了零数据泄露。数据集支持两种互补的评估轨道:视觉问答轨道和描述生成轨道,适用于机器人学、具身人工智能、细粒度视频理解等研究任务。
RoboFine-Bench is a benchmark dataset for evaluating the fine-grained understanding capabilities of vision-language models on robotic manipulation videos. It aims to test whether models can go beyond coarse-grained task recognition to deeply understand the specific how of robot task execution, capturing details at the implementation level. The dataset contains 500 strictly reserved robotic manipulation video trajectories, sourced from 10 open-source robotic datasets (such as BridgeData-V2, RT-1, etc.), covering 32 different robotic arm morphologies, diverse camera perspectives, and a wide range of manipulation tasks. Each video trajectory is equipped with manually reviewed, step-level annotations, forming a total of 10,816 atomic facts across ten dimensions, with an average of 4.3 steps and 21.6 facts per sample. These ten fine-grained dimensions include: action sequence, executing agent (active arm), target object, initial configuration, final configuration, contact and proximity, trajectory and orientation, body motion, object interaction, and failure and recovery. All benchmark trajectories are strictly non-overlapping with the training set (47,159 samples), ensuring zero data leakage. The dataset supports two complementary evaluation tracks: a visual question answering track and a description generation track, and is suitable for research tasks in robotics, embodied AI, fine-grained video understanding, and more.
数据集简介
RoboFine-Bench 是一个用于评估视觉语言模型(VLM)对机器人操作执行层面细节理解能力的基准测试,旨在超越粗粒度的任务识别,深入理解机器人如何执行任务。它是 FineVLA 框架的一部分。
核心数据
- 规模: 包含 500 条来自 10 个机器人数据集的独立测试操作视频。
- 多样性: 覆盖 32 种机器人本体形态、多种摄像机视角及广泛的操作任务。
- 标注: 每条轨迹含有人工审核的步骤级标注,被分解为 10,816 个原子事实,涵盖十个动作相关维度。每样本平均 4.3 步和 21.6 个事实。
- 数据隔离: 所有 500 条轨迹与训练集(47,159 条样本)和策略训练数据严格不重叠,确保零数据泄露。
评价维度
基准测试从十个与机器人控制相关的细粒度维度进行评价:
| 维度 | 描述 | 关键插槽 |
|---|---|---|
| 动作序列 | 分步执行顺序 | primitive_action, gripper_state |
| 主动执行体 | 使用的机械臂或末端执行器 | actor |
| 目标对象 | 物体消歧 | category, color, material, shape_or_size |
| 初始配置 | 物体和机器人的起始状态 | initial_pose, initial_workspace_location, initial_relation, initial_state |
| 最终配置 | 操作后的最终状态 | final_pose, final_workspace_location, final_relation, final_state |
| 接触与接近 | 接触位置和方式 | contact_region, approach_direction |
| 轨迹与朝向 | 运动路径和工具朝向 | translation_direction, translation_extent, rotation_direction, rotation_angle, path_shape |
| 身体运动 | 全身或关节级运动 | base_motion, torso_motion, camera_motion |
| 物体交互 | 操作中物体间的关系 | interaction_type, affected_object, effect |
| 失败与恢复 | 错误处理和恢复行为 | failure, retry, recovery_result, attempt_count |
评价轨道
提供两个互补的评价轨道:
- VQA 轨道:通过 1,030 个问题评估判别式理解能力。问题覆盖上述十个维度,汇总为三个报告轴:实体与场景定位、动作与运动理解、交互与状态推理。
- 字幕轨道:通过让模型生成分步操作描述,评估生成式理解能力。生成的描述与原子事实进行比对,获得一致性、覆盖率和反幻觉三个指标。包含两种设置:简单(提供任务指令)和困难(仅依据视觉观察)。
基准测试结果(摘录)
- VQA 结果:RoboFine-VLM(论文模型)以 71.0% 的总准确率领先。
- 字幕结果:在“简单”设置下,RoboFine-VLM 总分为 85.2%;在“困难”设置下总分为 83.6%。
数据文件结构
RoboFine-Bench/ ├── videos/ # 500 个机器人操作视频 ├── EvalSets.json # 用于字幕评价的基准事实步骤级标注集 ├── QAEvalSets.json # 1,030 个 VQA 问题及答案 └── GT_AtomicFacts.jsonl # 10,816 个用于字幕评分的原子事实
数据来源
视频来自以下 10 个开源机器人数据集,每个数据集抽取 50 条轨迹: BridgeData-V2、BC-Z、RT-1、Galaxea、RoboMIND-V1、RoboMIND-V2、RoboCOIN、RH20T、RDT、DROID
许可协议




