galaxea-a1-lingbot-va-real-world-evaluations
收藏资源简介:
该数据集记录了LingBot-VA模型在真实机器人(Galaxea-A1)上执行水果放置任务的评估结果与过程数据。核心内容围绕两个经过微调的模型检查点(Fruit step-1000和Mango step-200)展开,旨在评估其基于语言指令的端到端控制能力与世界模型。数据集包含多种形式的评估证据:在真实机器人上执行的闭环运行视频(用于判定任务成败)、每个控制周期保存的短期滚动未来预测视频序列、以及从单一观察出发离线生成的全视野开环预测视频与动作序列。评估覆盖了多种场景布局,包括标准配置(Official)、物体/容器交换配置(Swapped)、多种随机摆放配置(Random A/B/C)以及针对未见过物体(桃子、青苹果)的分布外测试。数据集中提供了详细的评估结果清单(如成功/失败计数、具体失败模式分析)和大量视频文件,适用于机器人学习、视觉动作策略评估、模型泛化性分析与开闭环预测对比研究。
This dataset records the evaluation results and process data of the LingBot-VA model performing the fruit placement task on a real robot (Galaxea-A1). The core content revolves around two fine-tuned model checkpoints (Fruit step-1000 and Mango step-200), aiming to evaluate their end-to-end control capabilities and world models based on language instructions. The dataset includes various forms of evaluation evidence: closed-loop operation videos executed on the real robot (used to determine task success or failure), short-term rolling future prediction video sequences saved in each control cycle, and full-view open-loop prediction videos and action sequences generated offline from a single observation. The evaluation covers multiple scene layouts, including standard configuration (Official), object/container exchange configuration (Swapped), various random placement configurations (Random A/B/C), and out-of-distribution tests for unseen objects (peach, green apple). The dataset provides detailed evaluation result lists (such as success/failure counts, specific failure mode analysis) and a large number of video files, suitable for robot learning, visual action policy evaluation, model generalization analysis, and open-closed loop prediction comparison studies.
数据集概述:LingBot-VA Fruit Placement Evaluation
基本信息
- 数据集名称: LingBot-VA Fruit Placement — Base, Fruit and Mango
- 许可证: Apache-2.0
- 任务类别: 机器人技术 (robotics)
- 语言: 英语 (en)
- 标签: galaxea-a1, lingbot-va, real-robot, evaluation, world-model, fruit-placement, eef-control
- 配置: 包含一个配置
evaluations,数据文件为manifests/evaluations.csv
数据集内容
该数据集用于评估LingBot-VA模型在真实机器人上的水果放置任务表现,基于Galaxea A1机器人平台,使用末端执行器控制 (EEF)。
评估的检查点
数据集包含三个模型的评估结果:
| 检查点 | 训练内容 | 评估数据量 | 主要结果 |
|---|---|---|---|
| Fruit step-1000 (五任务检查点) | 香蕉→盘子/碗, 柠檬→盘子, 红芒果→盘子/碗; 130个episodes; 柠檬→碗为保留任务; 桃子和青苹果为未见物体 | 42次实机关闭循环评估, 42次全视野开环预测, 360次滚动未来预测 | 官方布局6/6成功; Random C布局3/18; 桃子0/3; 青苹果1/2 |
| Mango step-200 (仅芒果检查点) | 红芒果→盘子/碗; 52个episodes | 18次实机评估, 6次全视野开环预测, 851次滚动未来预测 | 5/18次正确物体; 6次香蕉/柠檬指令放置了芒果 |
| LingBot-VA base WAN (无A1微调) | 通用视频-动作预训练,无水果放置后训练 | 9次匹配的全视野开环预测 | 0/9次连贯的双摄像头完成; 0/9次前视图物体运输 |
证据类型
- 实机关闭循环 (Real closed-loop): 在机器人上执行,每次策略调用前使用新的摄像头观察。决定成功或失败。
- 滚动未来 (Rolling future): 每次关闭循环策略调用时保存的短视频/动作未来,用于分析,不作为下一个摄像头观察。
- 全视野开环 (Full-horizon open-loop): 从一次保存的观察开始,离线生成33个自回归块:528个动作槽和525个视频帧,无后续真实图像。
评估场景与结果
| 场景 | 描述 | 结果 |
|---|---|---|
| Fruit step-1000 · Official/Swapped/Random A/Random B | 标准及变体布局 | 12/19 成功 |
| Fruit step-1000 · Random C | 随机布局C | 3/18 成功 (全部为芒果指令) |
| Fruit step-1000 · 新物体OOD (桃子和青苹果) | 未见物体测试 | 桃子 0/3; 青苹果 1/2 |
| Mango step-200 · Original | 仅芒果检查点原始布局 | 5/18 正确物体; 6次使用芒果替代请求物体 |
关键发现
- Fruit step-1000 在官方布局中解决所有六个指令(包括保留任务柠檬→碗),但在随机布局C中降至3/18。
- 原始失败分析中,22次失败分为:10次错误目标/角色失败,9次获取或保留失败,3次运输/目的地/释放失败。
- 开环预测高估成功: 7/18视频看起来成功,但仅有3/18实机运行成功;4个成功视频缺少打开夹爪的块。
- 语言改变预测,但物体定位不稳定: 相同像素下,改变提示词使预测目标中值移动11.35厘米,而改变随机种子仅移动8.51厘米。
- 基线与微调对比: LingBot-VA base WAN完成0/9任务,A1微调创造了具身技能。基础模型与Fruit模型的EEF目标中值差异为16.8厘米,夹爪相位一致性为61.0%。
数据文件
- 评估数据文件路径:
manifests/evaluations.csv - 视频和资产文件托管于Hugging Face数据集仓库中,具体路径详见页面内的视频源地址。




