遇见数据集

MiGA

收藏
arXiv2026-08-25 更新2026-08-27 收录
数据链接:
官方服务:

资源简介:

MiGA是一个大规模多夹爪感知数据集,由利物浦大学等机构联合创建,旨在填补当前VLA模型因忽略夹爪形态差异而导致的策略学习空白。该数据集包含103,000条轨迹,覆盖平行夹爪、真空吸盘、三指夹爪、软体夹爪和灵巧手五种类型,涉及36项任务,配备多视角RGB-D观测、本体状态和子步骤分解,并包含约5%的失败演示以分析夹爪能力边界。数据通过人工遥操作在仿真和真实环境中采集,任务设计刻意引发形态依赖策略,确保同一目标下不同夹爪展现出截然不同的操作轨迹。该数据集可用于训练和评估夹爪感知的视觉语言动作模型,旨在解决机器人操作中由夹爪形态差异导致的策略泛化难题,推动具身智能向更鲁棒和自适应的方向发展。

MiGA is a large-scale multi-gripper perception dataset co-developed by the University of Liverpool and other institutions, aimed at filling the gap in policy learning in current Vision-Language-Action (VLA) models caused by their neglect of gripper morphology differences. This dataset contains 103,000 trajectories covering five types of grippers: parallel jaw grippers, vacuum suction cups, 3-finger grippers, soft grippers, and dexterous hands, spanning 36 tasks. It is equipped with multi-view RGB-D observations, proprioceptive states, and sub-step decompositions, and includes approximately 5% of failure demonstrations to analyze the performance boundaries of different grippers. The data is collected via manual teleoperation in both simulation and real-world environments. The task design intentionally induces morphology-dependent policies, ensuring that different grippers exhibit distinctly different manipulation trajectories for the same target. This dataset can be used to train and evaluate vision-language-action models for gripper perception, aiming to address the policy generalization challenge in robotic manipulation caused by differences in gripper morphology, and advancing embodied intelligence towards more robust and adaptive directions.

创建时间:
2026-08-25
原始信息汇总

GVLA: Gripper-aware Vision Language Action Models

数据集概述

GVLA 项目提出并发布了 MiGA (Multi-Gripper-Aware) 数据集,这是一个面向多夹爪感知的机器人操作数据集。该研究已被 ECCV 2026 接收。

MiGA 数据集核心信息

特性 详情
规模 103,000 条演示轨迹
夹爪类型 5 种不同夹爪类型
任务数量 36 个任务
环境 涵盖仿真环境与真实世界机器人设置
多机器人平台 数据来自多种机器人平台

数据集特点

  • 明确捕捉在相同任务目标下,不同夹爪类型(如平行夹爪与吸盘)所需的不同接触选择、接近方向和执行策略
  • 任务类别涵盖:分离(singulated)、堆叠(stacked)、受限(constrained)和语义(semantic)任务
  • 在任务类别和夹爪覆盖范围上保持平衡
  • 弥补了现有 VLA 数据集主要依赖平行夹爪、缺乏多夹爪感知学习的空白

GVLA 方法核心内容

GVLA 通过两种关键机制将夹爪本体信息注入 VLA 模型:

  1. 多夹爪分词器(Multi-gripper Tokenization):将机器人平台、夹爪类型和夹爪实例编码为可学习的 token,提供结构化条件信息。

  2. 双混合适配器(Dual Mixture-of-Adapters):通过平台感知和夹爪感知的适配器专家池,将计算路由到特定本体的策略。

实验结果摘要

  • 在仿真和真实世界验证中,GVLA 均优于当前基线方法
  • 提升了夹爪感知操作能力
  • 改善了对新物体的零样本泛化能力
  • 支持对未见任务或新夹爪的少样本适应
  • 在 UR5 机器人搭配 Robotiq 2F-85 夹爪的真实世界验证中展示了更优的适应性能

相关资源

  • 论文预印本(arXiv)
  • 数据集
  • 脚本代码

引用信息

该工作由利物浦大学、穆罕默德·本·扎耶德人工智能大学、印度科学研究所、东京大学、ZHAW、阿肯色大学、Physical Intelligence 和华中科技大学的研究人员合作完成,发表于 ECCV 2026。

搜集汇总
数据集介绍
MiGA 数据集图片
构建方式
在机器人操作研究领域,数据集的构建往往受限于单一夹具类型,忽视了夹具形态对抓取策略的根本性影响。MiGA数据集通过系统性设计,涵盖了五类广泛使用的夹具:平行夹爪、三指夹爪、软体两指夹爪、吸盘以及灵巧手,并基于多种机器人平台在仿真与真实环境中采集了103,000条演示轨迹。每个任务均包含至少三种不同夹具的演示,从而凸显相同任务目标下因夹具形态差异而导致的策略分化。数据采集采用多视角RGB-D相机(腕部与第三视角),并提供完整的轨迹、子步骤分解、夹具-策略对及自然语言描述,尤其包含约5%的失败演示,为学习夹具能力边界与挑战性操作提供了丰富监督。
使用方法
MiGA数据集可用于多种研究任务,包括复杂抓取的轨迹级规划、跨夹具学习及VLA基准评估。研究者可利用其全轨迹与子动作分解训练策略模型或规划算法;通过跨夹具策略比较,探索形态依赖的抓取策略学习;同时,其多夹具覆盖与真实-仿真配对的特性,使得VLA模型能够进行夹具条件化训练,并在跨夹具泛化与少样本适应场景下进行公平基准测试。数据集提供的自然语言描述与失败演示进一步支持多模态推理与鲁棒性分析,为夹具感知机器人学习研究提供了坚实的数据基础。
背景与挑战
背景概述
MiGA数据集由利物浦大学等多家国际机构于2026年联合创建,旨在解决视觉-语言-动作模型(VLA)中普遍存在的抓取器不变性假设问题。该数据集包含103,000条演示轨迹,涵盖平行爪、真空吸盘、三指、软体及灵巧手等五种抓取器类型,分布于仿真与真实环境。其核心研究问题在于探索抓取器形态如何影响抓取策略,并为训练具备抓取器感知能力的VLA提供基准。MiGA的推出填补了现有数据集(如Open X-Embodiment)单一抓取器类型的空白,为机器人操作领域的研究提供了重要资源,推动了抓取器感知策略学习的发展。
当前挑战
MiGA面临的挑战主要来自两个方面。在领域层面,现有VLA模型大多忽视抓取器形态对抓取策略的影响,导致模型无法适应多样化的抓取器,难以在复杂场景中实现高效操作。在数据集构建层面,收集五种抓取器在多个任务中的演示轨迹需要精密的跨平台协调与标注,确保策略差异的准确捕获,同时仿真与真实数据的一致性维护也颇具挑战。此外,如何设计有效的抓取器表示并融入VLA模型,以实现跨抓取器的泛化和适应,是当前研究的关键难点。
常用场景
经典使用场景
MiGA数据集作为首个大规模多夹爪感知数据集,为机器人操作研究提供了涵盖五种不同夹爪类型、十万余条轨迹的丰富资源。其经典使用场景聚焦于训练和评估视觉-语言-动作模型(VLA)在夹爪相关抓取任务中的表现,通过包含仿真与真实世界环境的混合数据,支持研究者探索夹爪形态对操作策略的深刻影响,从而推动具身智能策略学习的范式转变。
解决学术问题
该数据集解决了现有VLA数据集普遍存在的夹爪不变性假设问题,这些数据集大多仅采用平行爪夹爪,忽视了不同夹爪在实现相同任务目标时所需策略的显著差异。MiGA通过显式捕捉夹爪形态与操作策略之间的耦合关系,为学术界提供了研究夹爪依赖型策略学习的基础,填补了多夹爪感知策略研究的空白,并催生了夹爪感知VLA模型(GVLA)等创新方法,显著提升了复杂抓取任务的成功率。
实际应用
在实际应用中,MiGA数据集支持机器人系统在不同夹爪配置下的灵活部署,例如在工业生产线上,吸盘夹爪可直接吸取扁平物体,而平行爪夹爪则需通过推挤侧抓等策略,MiGA为这类场景提供了训练数据。此外,该数据集促进跨夹爪的零样本泛化和少样本适应,使机器人能够快速适应新型夹爪或任务,提升自动化操作效率与鲁棒性,尤其在物流分拣、装配作业等需要多夹爪协作的领域展现出广阔应用前景。
数据集最近研究
最新研究方向
在机器人操作领域,视觉语言行动模型(VLA)虽已取得显著进展,但现有数据集普遍依赖平行夹爪,忽视了夹爪形态对操作策略的根本性影响。MiGA数据集应运而生,其以103,000条轨迹覆盖五种夹爪类型,在仿真与真实环境中显式捕获同一任务因夹爪形态差异而产生的策略分化,为具身智能研究开辟了夹爪感知学习的新范式。该数据集不仅支持跨夹爪泛化与少样本适应,更通过多粒度夹爪标记化与双专家混合适配器机制,推动VLA从隐式假设夹爪不变性转向显式编码形态约束,为通用机器人操作迈向形态感知、策略分化的智能阶段奠定了关键数据与模型基础。
相关研究论文
  • 1
    Gripper-aware Vision Language Action Models利物浦大学; 穆罕默德·本·扎耶德人工智能大学; 印度科学研究所; 东京大学; 苏黎世应用科技大学; 阿肯色大学; 物理智能公司; 华中科技大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务