遇见数据集

xlangai/RoboFine-bench

收藏
Hugging Face2026-06-18 更新2026-05-31 收录
官方服务:

资源简介:

RoboFine-Bench是一个用于评估视觉语言模型(VLMs)是否能够捕捉机器人操作执行级细节的基准测试,它超越了粗粒度任务识别,专注于理解机器人如何执行任务。该基准是FineVLA框架的一部分,用于视觉语言动作学习中的细粒度指令对齐。它包含来自10个机器人数据集的500个保留的机器人操作视频,覆盖32种实施例、多样化的相机视角和广泛的操作任务。每个轨迹都配有人工审核的步骤级注释,分解为10,816个原子事实,跨越十个动作相关维度,平均每个样本有4.3个步骤和21.6个事实。所有500个基准轨迹与RoboFine-VLM SFT训练集和所有策略训练分割严格不相交,确保零数据泄露。评估包括两个轨道:VQA轨道(通过1,030个问题评估判别性理解)和Caption轨道(通过生成步骤级描述评估生成性理解)。

RoboFine-Bench is a benchmark for evaluating whether Vision-Language Models (VLMs) can capture execution-level details of robot manipulation — going beyond coarse task recognition to understand how a robot performs a task. It is part of the FineVLA framework for fine-grained instruction alignment in Vision-Language-Action learning. The benchmark contains 500 held-out robot manipulation videos from 10 robot datasets, covering 32 embodiments, diverse camera views, and a wide range of manipulation tasks. Each trajectory is paired with human-reviewed step-level annotations decomposed into 10,816 atomic facts across ten action-relevant dimensions, with an average of 4.3 steps and 21.6 facts per sample. All 500 benchmark trajectories are strictly disjoint from both the RoboFine-VLM SFT training set and all policy-training splits, ensuring zero data leakage. Evaluation includes two tracks: the VQA track (evaluating discriminative understanding through 1,030 questions) and the Caption track (evaluating generative understanding by producing step-level descriptions).

提供机构:
xlangai
搜集汇总
数据集介绍
xlangai/RoboFine-bench 数据集图片
构建方式
RoboFine-Bench是一个面向机器人操作视频的细粒度理解评测基准,旨在检验视觉语言模型对执行层面细节的捕捉能力。该基准从BridgeData-V2、BC-Z、RT-1、RH20T、DROID等10个公开机器人数据集中,精心挑选了500条未见过的操作视频轨迹,涵盖32种机器人形态与多样化视角。每条轨迹均经过人工审核,被细化为平均4.3个步骤,并跨十个动作相关维度提取出总计11,631条原子事实。所有基准轨迹与RoboFine-VLM训练集及策略训练划分严格互斥,确保了零数据泄露,从而为评估模型对操作过程的深层理解提供了可靠基础。
特点
该基准围绕十个控制相关维度展开,包括动作序列、主动执行器、目标物体、初始与末态构型、接触与接近方式、轨迹与朝向、身体运动、物体交互及失败恢复,这些维度通常被高层目标指令所忽略。RoboFine-Bench设有两套互补的评测轨道:VQA轨道通过1,030道区分性选择题评估模型对实体场景、动作运动及交互状态的感知能力;Caption轨道则要求模型生成逐步操作描述,并借助LLM对生成内容进行原子事实对齐评分,衡量一致性、覆盖度及抗幻觉性能。整体设计既兼顾了判别式与生成式理解,又通过易难两种设置考察模型在不同信息条件下的表现。
使用方法
用户可通过克隆HuggingFace仓库直接获取基准数据,其中包含视频文件、VQA问题集、Caption评测集及原子事实标注文件。VQA评测支持通过指定模型名称并调整并行数运行单一评估脚本;Caption评测分为两阶段,首先生成步骤级描述,随后执行原子事实对齐评分脚本。完整的评估代码托管在项目GitHub仓库中。该基准鼓励研究者在RoboFine-VLM及其他主流VLM基础上进行性能对比,尤其是针对细粒度执行层面的理解能力,从而推动机器人视觉语言行动学习向更高精度的指令对齐方向演进。
背景与挑战
背景概述
在机器人操作领域,视觉-语言模型(VLM)的研究长期聚焦于粗粒度的任务识别,而对执行层面的细粒度操控细节理解相对匮乏。为弥补这一空白,RoboFine-Bench应运而生,该基准由xlang-ai研究团队于2026年提出,隶属于FineVLA框架,核心研究问题在于评估VLM能否精准捕捉机器人操作的执行层级信息,如动作序列、接触方式与恢复行为等。基准汇集10个开源机器人数据集的500段轨迹,涵盖32种本体与多样化视角,并配备11,631条人工审核的原子事实标注,为细粒度操控理解提供了标准化的评估平台,对推动具身人工智能与视觉-语言-动作对齐研究具有深远影响。
当前挑战
RoboFine-Bench所应对的领域挑战在于:现有机器人数据集和VLM基准大多停留在任务级别的语义理解,而忽略了动作执行中的微观层面细节,导致模型在实际操控中无法区分细微的行为差异。构建过程中,研究者面临多源异质数据集的融合难题,需统一来自不同本体、传感器与环境的视频格式与标注体系;同时,确保500条基准轨迹与训练集严格分离,以防止数据泄露。此外,为涵盖十种动作相关维度,标注过程需高成本的人工审核,以生成11,631条精确的原子事实,这要求标注者具备机器人操控的专业知识,显著提升了基准构建的复杂性。
常用场景
经典使用场景
在具身智能研究领域,RoboFine-Bench被设计为评估视觉语言模型(VLM)对机器人操作执行层面细节理解能力的基准。它通过提供来自10个机器人数据集的500段操作视频,并为之配备手工校验的逐步骤标注,涵盖动作序列、主动执行器、目标物体、初始与最终构型、接触方式、轨迹与朝向、身体运动、物体交互、失败与恢复等十个细粒度维度,从而全面评测模型对机器人操作过程的辨别性与生成性理解。该基准包含视觉问答与字幕生成两条评测轨道,分别对应判别式理解与生成式理解,为衡量模型是否真正掌握机器人操作的执行细节提供了标准化评估框架。
衍生相关工作
RoboFine-Bench的发布推动了多项衍生研究工作,其中最典型的是FineVLA框架——一个专注于细粒度指令对齐的视觉-语言-动作学习范式,该框架利用RoboFine-Bench作为核心评估工具,提出了面向执行细节的指令对齐方法。此外,该基准促进了基于原子事实对齐的机器人视频字幕生成方法的发展,研究者开始探索利用字幕生成中的一致性、覆盖率和抗幻觉指标来衡量操作视频理解质量。受其细粒度评测维度的启发,后续工作还延伸出针对特定操作维度(如主动执行器识别与接触方式分类)的专项评测数据集,深化了对机器人操作理解瓶颈的剖析。
数据集最近研究
最新研究方向
在具身智能与机器人操作领域,当前前沿研究方向正从粗粒度的任务识别转向对执行级细节的微观理解。RoboFine-Bench应运而生,它通过汇聚来自10个公开数据集的500段机器人操作视频,细粒度拆解出覆盖动作序列、接触方式、轨迹姿态、错误恢复等10个维度的1万余条原子事实,构建了迄今为止最为精细的机器人视频理解基准。这一基准的设立恰逢视觉-语言-动作(VLA)模型蓬勃发展之际,它与FineVLA框架深度耦合,不仅以VQA和描述生成双轨评估模型对操作过程的理解能力,更揭示了通用视觉语言模型在精细指令对齐上的显著短板。通过严格区分训练与评估数据,该基准为零样本泛化能力提供了可靠度量,为具身智能体实现可操控、可审计的精细操作行为奠定了关键评价基础,推动领域从‘识别任务’迈向‘理解执行’的新阶段。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务