遇见数据集

galaxea-a1-lingbot-va-real-world-evaluations

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

该数据集记录了LingBot-VA模型在真实机器人(Galaxea-A1)上执行水果放置任务的评估结果与过程数据。核心内容围绕两个经过微调的模型检查点(Fruit step-1000和Mango step-200)展开,旨在评估其基于语言指令的端到端控制能力与世界模型。数据集包含多种形式的评估证据:在真实机器人上执行的闭环运行视频(用于判定任务成败)、每个控制周期保存的短期滚动未来预测视频序列、以及从单一观察出发离线生成的全视野开环预测视频与动作序列。评估覆盖了多种场景布局,包括标准配置(Official)、物体/容器交换配置(Swapped)、多种随机摆放配置(Random A/B/C)以及针对未见过物体(桃子、青苹果)的分布外测试。数据集中提供了详细的评估结果清单(如成功/失败计数、具体失败模式分析)和大量视频文件,适用于机器人学习、视觉动作策略评估、模型泛化性分析与开闭环预测对比研究。

This dataset records the evaluation results and process data of the LingBot-VA model performing the fruit placement task on a real robot (Galaxea-A1). The core content revolves around two fine-tuned model checkpoints (Fruit step-1000 and Mango step-200), aiming to evaluate their end-to-end control capabilities and world models based on language instructions. The dataset includes various forms of evaluation evidence: closed-loop operation videos executed on the real robot (used to determine task success or failure), short-term rolling future prediction video sequences saved in each control cycle, and full-view open-loop prediction videos and action sequences generated offline from a single observation. The evaluation covers multiple scene layouts, including standard configuration (Official), object/container exchange configuration (Swapped), various random placement configurations (Random A/B/C), and out-of-distribution tests for unseen objects (peach, green apple). The dataset provides detailed evaluation result lists (such as success/failure counts, specific failure mode analysis) and a large number of video files, suitable for robot learning, visual action policy evaluation, model generalization analysis, and open-closed loop prediction comparison studies.

创建时间:
2026-07-19
原始信息汇总

数据集概述:LingBot-VA Fruit Placement Evaluation

基本信息

  • 数据集名称: LingBot-VA Fruit Placement — Base, Fruit and Mango
  • 许可证: Apache-2.0
  • 任务类别: 机器人技术 (robotics)
  • 语言: 英语 (en)
  • 标签: galaxea-a1, lingbot-va, real-robot, evaluation, world-model, fruit-placement, eef-control
  • 配置: 包含一个配置 evaluations,数据文件为 manifests/evaluations.csv

数据集内容

该数据集用于评估LingBot-VA模型在真实机器人上的水果放置任务表现,基于Galaxea A1机器人平台,使用末端执行器控制 (EEF)

评估的检查点

数据集包含三个模型的评估结果:

检查点 训练内容 评估数据量 主要结果
Fruit step-1000 (五任务检查点) 香蕉→盘子/碗, 柠檬→盘子, 红芒果→盘子/碗; 130个episodes; 柠檬→碗为保留任务; 桃子和青苹果为未见物体 42次实机关闭循环评估, 42次全视野开环预测, 360次滚动未来预测 官方布局6/6成功; Random C布局3/18; 桃子0/3; 青苹果1/2
Mango step-200 (仅芒果检查点) 红芒果→盘子/碗; 52个episodes 18次实机评估, 6次全视野开环预测, 851次滚动未来预测 5/18次正确物体; 6次香蕉/柠檬指令放置了芒果
LingBot-VA base WAN (无A1微调) 通用视频-动作预训练,无水果放置后训练 9次匹配的全视野开环预测 0/9次连贯的双摄像头完成; 0/9次前视图物体运输

证据类型

  1. 实机关闭循环 (Real closed-loop): 在机器人上执行,每次策略调用前使用新的摄像头观察。决定成功或失败。
  2. 滚动未来 (Rolling future): 每次关闭循环策略调用时保存的短视频/动作未来,用于分析,不作为下一个摄像头观察。
  3. 全视野开环 (Full-horizon open-loop): 从一次保存的观察开始,离线生成33个自回归块:528个动作槽和525个视频帧,无后续真实图像。

评估场景与结果

场景 描述 结果
Fruit step-1000 · Official/Swapped/Random A/Random B 标准及变体布局 12/19 成功
Fruit step-1000 · Random C 随机布局C 3/18 成功 (全部为芒果指令)
Fruit step-1000 · 新物体OOD (桃子和青苹果) 未见物体测试 桃子 0/3; 青苹果 1/2
Mango step-200 · Original 仅芒果检查点原始布局 5/18 正确物体; 6次使用芒果替代请求物体

关键发现

  • Fruit step-1000 在官方布局中解决所有六个指令(包括保留任务柠檬→碗),但在随机布局C中降至3/18。
  • 原始失败分析中,22次失败分为:10次错误目标/角色失败,9次获取或保留失败,3次运输/目的地/释放失败。
  • 开环预测高估成功: 7/18视频看起来成功,但仅有3/18实机运行成功;4个成功视频缺少打开夹爪的块。
  • 语言改变预测,但物体定位不稳定: 相同像素下,改变提示词使预测目标中值移动11.35厘米,而改变随机种子仅移动8.51厘米。
  • 基线与微调对比: LingBot-VA base WAN完成0/9任务,A1微调创造了具身技能。基础模型与Fruit模型的EEF目标中值差异为16.8厘米,夹爪相位一致性为61.0%。

数据文件

  • 评估数据文件路径: manifests/evaluations.csv
  • 视频和资产文件托管于Hugging Face数据集仓库中,具体路径详见页面内的视频源地址。
搜集汇总
数据集介绍
galaxea-a1-lingbot-va-real-world-evaluations 数据集图片
构建方式
在机器人操作与具身智能研究领域,LingBot-VA模型在真实世界中的泛化能力亟待系统性评估。本数据集正是为此而生,它记录了在Galaxea A1机器人平台上执行水果放置任务的完整评估数据。数据集构建方式严谨,主要通过三类证据收集:真实闭环轨迹(real closed-loop),即每次策略调用前获取新相机观测并在真实机器人上执行,用以判定任务成败;滚动未来(rolling future),在每次闭环策略调用时保存短视频与动作预测,仅供后续分析;全视野开环(full-horizon open-loop),从单次保存的观测出发,离线自回归生成33个片段,包含528个动作槽与525帧视频。评估覆盖Fruit step-1000(五任务检查点)、Mango step-200(仅芒果检查点)及LingBot-VA base WAN(无微调基线)三种模型状态,在不同场景布局(官方、交换、随机A/B/C)及新物体(桃子、青苹果)条件下进行。
特点
本数据集的核心特点在于其对真实世界评估的深度与多维性。首先,它提供了从真实闭环执行到离线开环预测的完整证据链,使研究者能清晰对比模型在模拟预测与实际操作间的差异。其次,数据集揭示了关键发现:闭环与开环预测存在显著不一致,开环往往高估成功率,例如Fruit step-1000在Random C布局中开环预测有7/18看似成功,但真实闭环仅3/18成功。此外,数据展示了语言指令对预测的影响,相同像素下改变提示词使预测目标中位数偏移11.35厘米,表明物体接地仍不稳定。数据还包含了新物体(桃子、青苹果)的零样本评估、基础模型与微调模型的消融对比,以及精细的错误分类(如错误目标、获取失败、放置失败等),为理解视觉-语言-动作模型的具身技能学习提供了丰富素材。
使用方法
本数据集的使用方法灵活多样,适用于机器人学习与评估的多个环节。数据以CSV清单文件形式提供,可通过Hugging Face Datasets库加载,使用`load_dataset`函数指定配置名`evaluations`即可获取评估数据。核心评估数据包含三类证据文件:真实闭环视频演示了机器人在实际场景中的执行过程;滚动未来源自策略每次调用时保存的未来预测;全视野开环视频则从单一观测出发生成完整任务序列。研究者可利用这些数据复现评估结果,比较不同检查点的性能,分析模型在场景变化、物体分布偏移和指令变化下的泛化表现。数据还支持消融研究,例如通过对比基础WAN模型与微调模型的输出,研究者可以评估微调对技能学习的贡献。对于希望深入分析预测一致性的用户,数据中包含了相同像素不同种子和提示词的因子化实验,可用于研究语言指导对生成动作的影响。
背景与挑战
背景概述
在机器人操作领域,基于视觉与语言指令的灵巧操作一直是研究的前沿与难点。LingBot-VA水果放置评测数据集由上海纽约大学(NYUSH)彭玥与罗宾特(Robbyant)等研究人员于近期创建,旨在评估基于视频与动作联合建模的世界模型在真实机器人上的表现。该数据集依托于Galaxea A1双机械臂平台,聚焦于将香蕉、柠檬、芒果等水果精准放置到盘子或碗中的任务。通过对微调后的LingBot-VA基座模型进行大规模真实世界评测,数据集系统性地揭示了视频动作模型在闭环控制中的成功率、泛化能力与开放世界鲁棒性,为机器人学习领域提供了一个高标准的基准评测框架。
当前挑战
该数据集所解决的核心领域问题在于,视频动作模型在真实机器人上的闭环控制能力与开放世界泛化挑战。具体挑战包括:1)模型在训练场景中表现优异,但面临场景变化(如随机布局)时成功率从100%骤降至16.7%,暴露出对场景结构的过拟合与对象-角色语义绑定不稳定;2)面对未见过的新物体(如桃子、青苹果)时模型近乎完全失效,体现了开放世界泛化的巨大鸿沟;3)开环预测显著高估了实际性能,开环与闭环执行间的端效应器目标位置差异中位数达8.88厘米,且夹爪相位一致性仅52.7%。在构建过程中,数据集面临着设计多维度评测场景(官方、交换、随机布局)以及系统化比较不同检查点与基座模型的复杂挑战。
常用场景
经典使用场景
在机器人操作与具身智能研究领域,该数据集为评估视觉-语言-动作(VLA)模型在真实物理世界中的表现提供了标准化的评测框架。其经典使用场景聚焦于水果放置任务,涵盖多种物体(如香蕉、柠檬、芒果)与容器(盘子、碗)的组合,并设计了包含官方布局、随机布局及未见物体(如桃子、青苹果)在内的多样化评测场景。通过记录机器人闭环执行、开环预测及滚动未来状态等多模态证据,该数据集能够系统地检验模型在物体识别、抓取、运输与释放等子任务上的综合能力,尤其适用于分析语言指令在相同视觉输入下对预测行为的影响。
实际应用
在实际应用中,该数据集为自动化仓储分拣、家庭服务机器人及智能农业采摘等场景提供了可复现的基准测试方案。例如,机器人可通过微调后的模型根据语言指令(如“将香蕉放入蓝色盘子”)执行精细操作,其评测结果可直接指导生产环境中物体抓取与放置算法的迭代。数据集中的失败案例分析(如抓取不稳定、释放相位缺失)为机械臂末端执行器控制策略的优化提供了具象化依据,而开环与闭环预测的差异度量则有助于设计更可靠的实时反馈系统,显著降低实际部署中的安全风险。
衍生相关工作
该数据集衍生出的经典工作涵盖VLA模型微调与消融研究。基于Fruit step-1000与Mango step-200检查点,研究者系统对比了全参数微调与基础预训练模型在水果放置任务上的性能差异,证实了任务特定数据对具身技能涌现的关键作用。相关工作进一步扩展至跨场景泛化分析,通过固定像素而改变语言提示的实验设计,揭示了VLA模型对语言指令的敏感性及其在物体接地(object grounding)上的不稳定性。此外,针对开环预测中夹爪相位缺失的常见失败模式,后续研究引入了时序一致性约束,催生了结合滚动未来状态与闭环校正的混合执行架构,为提升模型在动态环境中的可靠性奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务