FineVLA-Data
收藏资源简介:
FineVLA-Data是由香港大学和阿里巴巴团队联合构建的细粒度视觉-语言-动作对齐数据集,旨在为机器人操控提供过程级指令监督。该数据集整合了10个开源机器人数据集的97.2万条原始轨迹,经过动态时间规整聚类和人工验证,最终形成包含47,159条代表性轨迹的语料库,每条轨迹的平均指令长度从9.3词扩展至96.8词,实现了10.4倍的信息密度提升。数据集通过四阶段流水线构建:首先统一异构数据格式,然后进行动作状态规范化处理,接着基于DTW相似性聚类选择代表性样本,最后采用十维度细粒度标注框架对动作序列、执行主体、接触区域等关键执行因素进行结构化描述。该数据集主要应用于可操控VLA策略训练和机器人视频理解,解决了传统机器人数据集仅包含粗粒度目标指令而缺乏执行细节指导的问题,为机器人学习人类指定的执行约束提供了数据基础。
FineVLA-Data is a fine-grained vision-language-action (VLA) alignment dataset jointly constructed by teams from The University of Hong Kong and Alibaba, aiming to provide process-level instruction supervision for robotic manipulation. This dataset integrates 972,000 original trajectories from 10 open-source robotic datasets. After Dynamic Time Warping (DTW) clustering and manual verification, it finally forms a corpus containing 47,159 representative trajectories. The average instruction length per trajectory has been expanded from 9.3 words to 96.8 words, achieving a 10.4-fold improvement in information density. The dataset is built via a four-stage pipeline: first, unify heterogeneous data formats; second, normalize action states; third, select representative samples through DTW-based similarity clustering; and fourth, adopt a ten-dimensional fine-grained annotation framework to structurally describe key execution factors such as action sequences, execution subjects and contact areas. This dataset is mainly applied to the training of controllable VLA policies and robotic video understanding, solving the problem that traditional robotic datasets only contain coarse-grained target instructions but lack guidance on execution details, and providing a solid data foundation for robots to learn execution constraints specified by humans.
数据集概述
FineVLA 是一个全开源框架,旨在实现精细粒度的动作-指令对齐,连接了精细数据构建、机器人视频理解、可扩展标注和可操控的 VLA 策略学习。
核心组成
- FineVLA-Tool & FineVLA-Data:统一了来自 10 个数据集的 972,247 条轨迹,并构建了 47,159 条经过人工验证的精细粒度轨迹。
- RoboFine-Bench:一个保留基准,包含 500 个视频、10,816 条原子事实和 1,030 个 VQA 问题。
- RoboFine-VLM:一个专为机器人领域设计的视觉语言模型(VLM)标注器。
- FineVLA-Policy:一种可操控的策略,通过控制精细粒度和原始目标级指令的混合比例进行训练。
数据规模与关键统计
| 指标 | 数值 |
|---|---|
| Trajectories | 47,159 |
| Source Datasets | 10 |
| Total Steps | 220,606 |
| Annotation Dimensions | 10 |
| 指令信息密度提升 | 10.4× |
基准(RoboFine-Bench)
- 规模:500 个视频,10,816 条原子事实,1,030 个 VQA 问题
- 评估维度:10 个维度,包括动作序列、主动执行器、目标物体、初始/最终配置、接触与接近、轨迹与方向、身体运动、物体交互、失败与恢复
- 评估任务:视频描述标注(Captioning)和视觉问答(VQA)
实验与结果
- RoboFine-VLM 在 RoboFine-Bench 上达到 71.0% VQA 准确率和 83.6% 描述得分,性能优于 GPT-5.4 和 Gemini 3.1 Pro。
- FineVLA-Policy 在仿真和真实场景中,最佳精细:原始(FG:Raw)指令混合比例为 1:1:
- 仿真(AlohaMix-OFT):Easy 任务 86.8%,Hard 任务 82.5%,相比纯原始指令提升 +15.0/+11.1。
- 真实双臂操作:平均得分 62.7/100(纯原始指令为 49.9),指令违规率从 34% 降至 12%。

- 1FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies香港大学·XLANG实验室; 阿里巴巴集团·通义千问团队 · 2026年




