遇见数据集

RoboFine-bench

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

RoboFine-Bench是一个用于评估视觉语言模型对机器人操作视频细粒度理解能力的基准数据集。它旨在检验模型是否能够深入理解机器人执行任务的具体方式,捕捉执行层面的细节。数据集包含500个严格保留的机器人操作视频轨迹,这些视频来自10个开源机器人数据集(如BridgeData-V2、RT-1等),涵盖了32种不同的机械臂形态、多样的相机视角和广泛的操控任务。每个视频轨迹都配备了经过人工审核的、分解到步骤级别的标注,总计形成了10,816个跨十个维度的“原子事实”,平均每个样本包含4.3个步骤和21.6个事实。这十个细粒度维度包括:动作序列、执行主体(主动臂)、目标物体、初始配置、最终配置、接触与接近方式、轨迹与朝向、身体运动、物体交互以及失败与恢复。所有基准轨迹均与训练集(47,159个样本)严格不重叠,确保了零数据泄露。数据集支持两种互补的评估轨道:视觉问答轨道和描述生成轨道,适用于机器人学、具身人工智能、细粒度视频理解等研究任务。

RoboFine-Bench is a benchmark dataset for evaluating the fine-grained understanding capabilities of vision-language models on robotic manipulation videos. It aims to test whether models can go beyond coarse-grained task recognition to deeply understand the specific how of robot task execution, capturing details at the implementation level. The dataset contains 500 strictly reserved robotic manipulation video trajectories, sourced from 10 open-source robotic datasets (such as BridgeData-V2, RT-1, etc.), covering 32 different robotic arm morphologies, diverse camera perspectives, and a wide range of manipulation tasks. Each video trajectory is equipped with manually reviewed, step-level annotations, forming a total of 10,816 atomic facts across ten dimensions, with an average of 4.3 steps and 21.6 facts per sample. These ten fine-grained dimensions include: action sequence, executing agent (active arm), target object, initial configuration, final configuration, contact and proximity, trajectory and orientation, body motion, object interaction, and failure and recovery. All benchmark trajectories are strictly non-overlapping with the training set (47,159 samples), ensuring zero data leakage. The dataset supports two complementary evaluation tracks: a visual question answering track and a description generation track, and is suitable for research tasks in robotics, embodied AI, fine-grained video understanding, and more.

创建时间:
2026-05-26
原始信息汇总

数据集简介

RoboFine-Bench 是一个用于评估视觉语言模型(VLM)对机器人操作执行层面细节理解能力的基准测试,旨在超越粗粒度的任务识别,深入理解机器人如何执行任务。它是 FineVLA 框架的一部分。

核心数据

  • 规模: 包含 500 条来自 10 个机器人数据集的独立测试操作视频。
  • 多样性: 覆盖 32 种机器人本体形态、多种摄像机视角及广泛的操作任务。
  • 标注: 每条轨迹含有人工审核的步骤级标注,被分解为 10,816 个原子事实,涵盖十个动作相关维度。每样本平均 4.3 步和 21.6 个事实。
  • 数据隔离: 所有 500 条轨迹与训练集(47,159 条样本)和策略训练数据严格不重叠,确保零数据泄露。

评价维度

基准测试从十个与机器人控制相关的细粒度维度进行评价:

维度 描述 关键插槽
动作序列 分步执行顺序 primitive_action, gripper_state
主动执行体 使用的机械臂或末端执行器 actor
目标对象 物体消歧 category, color, material, shape_or_size
初始配置 物体和机器人的起始状态 initial_pose, initial_workspace_location, initial_relation, initial_state
最终配置 操作后的最终状态 final_pose, final_workspace_location, final_relation, final_state
接触与接近 接触位置和方式 contact_region, approach_direction
轨迹与朝向 运动路径和工具朝向 translation_direction, translation_extent, rotation_direction, rotation_angle, path_shape
身体运动 全身或关节级运动 base_motion, torso_motion, camera_motion
物体交互 操作中物体间的关系 interaction_type, affected_object, effect
失败与恢复 错误处理和恢复行为 failure, retry, recovery_result, attempt_count

评价轨道

提供两个互补的评价轨道:

  1. VQA 轨道:通过 1,030 个问题评估判别式理解能力。问题覆盖上述十个维度,汇总为三个报告轴:实体与场景定位、动作与运动理解、交互与状态推理。
  2. 字幕轨道:通过让模型生成分步操作描述,评估生成式理解能力。生成的描述与原子事实进行比对,获得一致性、覆盖率和反幻觉三个指标。包含两种设置:简单(提供任务指令)和困难(仅依据视觉观察)。

基准测试结果(摘录)

  • VQA 结果:RoboFine-VLM(论文模型)以 71.0% 的总准确率领先。
  • 字幕结果:在“简单”设置下,RoboFine-VLM 总分为 85.2%;在“困难”设置下总分为 83.6%

数据文件结构

RoboFine-Bench/ ├── videos/ # 500 个机器人操作视频 ├── EvalSets.json # 用于字幕评价的基准事实步骤级标注集 ├── QAEvalSets.json # 1,030 个 VQA 问题及答案 └── GT_AtomicFacts.jsonl # 10,816 个用于字幕评分的原子事实

数据来源

视频来自以下 10 个开源机器人数据集,每个数据集抽取 50 条轨迹: BridgeData-V2、BC-Z、RT-1、Galaxea、RoboMIND-V1、RoboMIND-V2、RoboCOIN、RH20T、RDT、DROID

许可协议

MIT License

搜集汇总
数据集介绍
RoboFine-bench 数据集图片
构建方式
RoboFine-Bench的构建旨在弥补现有视觉-语言模型在细粒度机器人操作视频理解中的不足。该基准精选自10个开源机器人数据集的500段严格保密的操作视频,覆盖32种机器人形态与多样化视角。每一段轨迹均经由人工精心审核,被解构为10816个原子事实,平均每样本包含4.3个步骤和21.6个事实。所有基准轨迹均与训练集及策略训练划分严格不重叠,确保了零数据泄漏。构建过程聚焦于十个与动作控制紧密相关的维度,包括动作序列、主动执行体、目标物体、初始与最终构型、接触与接近方式、轨迹与朝向、身体运动、物体交互以及失败与恢复,从而实现了对机器人操作执行层面细节的全面捕捉。
特点
RoboFine-Bench的核心特点在于其极高的细粒度与多维度的评估框架。它超越了粗粒度的任务识别,深入到机器人如何执行动作的层面,通过十个控制相关维度系统性地评估模型对执行细节的理解能力。该基准包含两个互补的评估轨道:VQA轨道通过1030道判别式问题衡量模型在实体与场景接地、动作与运动理解、交互与状态推理三个报告轴上的表现;Caption轨道则通过生成式描述评估模型的创造性理解,并利用LLM基于原子事实进行匹配,输出一致性、覆盖率和抗幻觉三项指标。这种双轨设计兼顾了判别与生成能力,为模型在机器人操作视频理解领域提供了全面而严格的测评。
使用方法
使用RoboFine-Bench进行模型评估需遵循标准化的流程。首先,通过git clone命令下载包含500段视频、评估集JSON文件和原子事实文件的完整基准包。在VQA评估中,研究人员需安装必要的依赖库,并调用run_vqa.py脚本,指定模型名称后即可自动计算各维度准确率。在Caption评估中,则需分两步进行:先使用run_annotate.py生成模型的步骤级描述,再通过run_atomic_eval.sh脚本执行原子事实对齐评分,最终得到一致性、覆盖率和抗幻觉等细粒度指标。该方法支持轻松切换不同视觉-语言模型,便于进行公平的性能对比与消融分析。
背景与挑战
背景概述
RoboFine-Bench是由Xlang AI团队于2026年5月发布的细粒度机器人操作视频理解基准,隶属于FineVLA框架。该数据集旨在突破传统机器人任务理解仅关注宏观动作标签的局限,深入探究视觉-语言模型(VLM)对机器人执行层面细节的捕捉能力,例如具体操作顺序、接触区域、运动轨迹及故障恢复等维度。其核心研究问题在于评估VLM是否能够超越“做什么”而理解“如何做”,从而推动具身智能中精细指令对齐的发展。该基准涵盖10个开源机器人数据集中的500段持有视频,包含32种形态与多种视角,并配有经人工审核的10,816条原子事实标注,对后续VLA(视觉-语言-动作)学习研究具有重要参考价值。
当前挑战
当前领域面临的首要挑战在于,大多数VLM在面对机器人操作视频时,仅能识别粗粒度任务目标,而无法理解精确的动作序列、物体交互细节及故障恢复等执行级信息,这严重制约了机器人从观察中学习精细操作的能力。RoboFine-Bench的构建过程同样面临多重挑战:首先,需从10个异构数据源(如BridgeData-V2、RT-1等)中严格筛选出与训练集和策略集零重叠的500段视频,以确保评估的公平性;其次,设计覆盖十个控制相关维度的细粒度标注体系,并确保人工标注的高一致性;最后,针对VQA与Caption双轨评估设计复杂而精确的自动评分机制,以量化模型在实体定位、动作理解与状态推理等方面的表现。
常用场景
经典使用场景
在具身智能与机器人操作领域,RoboFine-Bench作为一项细粒度机器人视频理解基准,被广泛用于评估视觉-语言模型对机器人操作执行级细节的捕捉能力。该基准涵盖500个来自10个不同数据集的操作视频,涉及32种机器人形态,并针对每个轨迹提供人工审核的步骤级标注,分解为10,816个原子事实,覆盖动作序列、目标物体、接触方式等十个关键维度。其经典评估任务包括视觉问答与描述生成两大方向,前者通过1,030道判别式问题检验模型对实体场景、动作运动以及交互状态的细粒度理解,后者则要求模型生成逐步操作描述并依据一致性、覆盖度与抗幻觉指标进行评分。
实际应用
在实际应用层面,RoboFine-Bench为机器人操作系统的性能评估提供了标准化测试平台。开发者可以利用该基准验证其视觉-语言模型在真实操作场景中的细粒度理解能力,例如判断模型能否准确识别机械臂使用的具体夹爪、区分目标物体的颜色与材质、感知操作前后的位姿变化以及检测失败重试的行为。此外,该基准还可用于筛选适用于机器人任务的大语言模型,指导模型在实物操作前的模拟评估阶段进行针对性的能力诊断,从而降低在真实机器人上部署不成熟模型的风险,提升操作系统的鲁棒性与安全性。
衍生相关工作
RoboFine-Bench作为FineVLA框架的重要组成部分,衍生了一系列围绕细粒度指令对齐与可操控视觉-语言-动作策略的学术工作。基于该基准,研究团队构建了RoboFine-VLM模型——一个具备细粒度操作理解能力的专用视觉-语言模型,其在VQA与描述生成任务上均显著优于通用闭源模型。此外,该基准的原子事实标注思想也被扩展到其他机器人数据集的后处理与再标注研究中,推动了从粗粒度任务描述到精细操作指令转化的方法论发展。更广泛地,RoboFine-Bench的评估体系为具身智能领域的高质量基准设计提供了参考范式,催生了更多关注操作过程而非仅关注任务结果的细粒度理解研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务