遇见数据集

Multi-Embodiment Tabletop Grasping Dataset (SeededGrasp dataset)

收藏
arXiv2026-07-22 更新2026-07-24 收录
官方服务:

资源简介:

该数据集是由多伦多大学与Vector Institute等机构联合创建的首个多末端执行器桌面抓取数据集,专门针对复杂杂乱场景中的机器人抓取任务设计。数据集规模达256万个抓取姿态,覆盖610个杂乱场景、334个物体对象以及Franka Panda、Robotiq 3-Finger和Allegro三种典型夹爪,数据通过合成生成流程从MultiGripperGrasp数据集转化而来。创建过程采用物理仿真与启发式碰撞检测相结合的方法,将稳定抓取姿态适配到桌面杂乱场景中,并生成2048点云作为场景表示。该数据集主要应用于多模态机器人抓取研究领域,旨在解决语言引导的多末端执行器抓取在复杂场景中的泛化问题,为分离语义推理与几何执行的框架提供训练基础。

This dataset is the first multi-end-effector desktop grasping dataset jointly created by the University of Toronto, Vector Institute and other institutions, specifically tailored for robotic grasping tasks in complex cluttered scenes. It contains 2.56 million grasping poses, covering 610 cluttered scenes, 334 distinct objects, and three representative grippers: Franka Panda, Robotiq 3-Finger and Allegro. This dataset is derived from the MultiGripperGrasp dataset through a synthetic generation pipeline. The development process employs a hybrid approach combining physics simulation and heuristic collision detection, which adapts stable grasping poses to cluttered desktop scenes and generates 2048-point point clouds as scene representations. This dataset is primarily utilized in the field of multimodal robotic grasping research, aiming to address the generalization challenge of language-guided multi-end-effector grasping in complex scenes, and provide training foundations for frameworks that separate semantic reasoning and geometric execution.

创建时间:
2026-07-22
搜集汇总
数据集介绍
Multi-Embodiment Tabletop Grasping Dataset (SeededGrasp dataset) 数据集图片
构建方式
该数据集基于MultiGripperGrasp(MGG)中提供的数百万个空中稳定抓取位姿构建。首先,通过重力测试与六轴抓取测试对MGG中的位姿重新筛选,并精炼物体与夹爪模型以保证抓取质量。随后,从Google Scanned Objects和YCB数据集中选取334个物体,其中284个用于训练、50个用于评估,随机将1至10个物体从空中跌落至桌面以生成包含稀疏与密集区域的杂乱场景。通过将筛选后的空中抓取位姿变换至场景全局坐标系,并应用启发式碰撞检测(包括夹爪接近角度、桌面间隙及物体间穿透阈值)判断有效性,最终在610个场景中为Franka Panda、Robotiq三指和Allegro三种夹爪生成了约256万个有效抓取位姿,并融合四方向RGB-D图像生成2048点的场景点云。
特点
该数据集是首个融合多机械臂形态与杂乱桌面场景的抓取数据集,涵盖逾250万个抓取样本,包含从简单形状到不规则几何的334种物体,以及并行夹爪与灵巧手的代表性形态。其分布虽偏向Franka Panda夹爪(因简单运动学导致更多有效位姿),但通过均匀采样机制缓解了类别不平衡。场景构建模拟了真实杂乱环境,点云从多视图融合与下采样获得,并编码了法向量、曲率及种子点距离等丰富几何特征。数据集以标准化格式提供场景点云、抓取位姿及夹爪模型,支持灵活的数据增强(如随机旋转、平移与噪声注入),为多形态抓取建模提供了高质量的几何与运动学基础。
使用方法
数据集适用于训练基于种子点条件化的抓取生成模型。使用时,首先加载场景点云与目标夹爪的点云表示,并从数据集中提取地面真值种子点(即接近夹爪掌心位置的物体表面点)作为条件。通过流匹配模型学习从噪声位姿到稳定抓取分布的映射,损失函数加权平衡平移、旋转与关节角分量,并使用分类器自由引导增强条件约束。推理时,可替换为视觉语言模型(VLM)从俯视图像中零样本预测种子点,再通过欧拉法求解常微分方程生成最终抓取位姿。数据集支持跨夹爪的泛化评估,可通过均匀采样与数据增强提升模型鲁棒性,适用于语言引导、多形态抓取的仿真与真实场景迁移。
背景与挑战
背景概述
该数据集由多伦多大学、向量研究所、不列颠哥伦比亚大学及Google DeepMind的研究人员于2026年联合创建,旨在解决复杂场景下多形态机器人的语言引导抓取问题。核心研究问题在于如何高效地将高层语义意图(如自然语言指令)与底层几何接触推理相融合,同时支持多样化的机械臂末端执行器。该数据集包含超过250万个抓取姿态,覆盖610个杂乱场景、334个物体及三种典型夹爪(Franka Panda、Robotiq三指、Allegro灵巧手),为多形态抓取研究提供了首个大规模基准。其创新性地采用种子点作为视觉语言模型与轻量级抓取生成模型间的桥梁,显著降低了数据依赖与计算成本,推动了语言引导抓取从单一形态向多形态、从孤立物体向复杂场景的跨越,对机器人操作领域具有重要影响力。
当前挑战
当前挑战集中于三大层面。首先,领域核心难点在于如何在杂乱场景中实现精确的空间推理与任务对齐,现有方法或依赖视觉语言模型直接预测抓取导致空间感知不足,或需端到端训练消耗海量资源,难以扩展到多形态与复杂遮挡环境。其次,数据集构建过程中面临显著障碍:从MultiGripperGrasp数据集中转换并筛选数百万抓取姿态时,需设计高效的启发式碰撞检测(如夹爪与桌面间距≥0.5厘米、穿透阈值≤10毫米)以替代计算昂贵的动态仿真测试;同时,不同夹爪的可行抓取分布极不均衡,如Allegro灵巧手在场景中的有效抓取仅占原始数据的5.8%,需通过均匀采样策略缓解过拟合。此外,现有多形态数据集均无法同时提供杂乱多物体场景与多种夹爪标注,迫使研究团队从头创建合成数据管线并精心调整物体与夹爪模型,以确保高质量抓取样本的生成。
常用场景
经典使用场景
在复杂桌面场景下的多形态机械臂抓取任务中,SeededGrasp数据集被广泛用于训练和评估语言引导的抓取模型。该数据集涵盖了超过250万个抓取姿态,涉及610个杂乱场景、334个物体及三种不同的机械夹爪(Franka Panda、Robotiq三指夹爪和Allegro灵巧手),为研究者在多形态、多物体、高遮挡的环境中开展抓取学习提供了标准化的训练与评测基准。研究者通常利用该数据集评估模型在语言指令引导下从点云中预测种子点并生成稳定抓取姿态的能力,从而推动多形态抓取从单一几何可行向语义感知与任务导向发展。
衍生相关工作
基于SeededGrasp数据集,研究者衍生出了一系列重要的后续工作,包括将视觉-语言模型与流匹配生成框架更深度融合的抓取模型,以及探索多形态夹爪共享表示学习的跨形态抓取方法。该数据集还激发了关于种子点选择策略的进一步研究,如对比不同VLM(如Gemini与GPT系列)对抓取性能的影响,以及分析数据集规模对生成质量与泛化能力的边际效应。此外,部分工作在此数据集基础上引入了协作感知与碰撞避免机制,拓展了其在动态环境与多臂协作场景中的应用边界,进一步巩固了该数据集作为多形态桌面抓取领域基准数据平台的地位。
数据集最近研究
最新研究方向
在机器人灵巧抓取领域,最新研究聚焦于将视觉-语言模型(VLM)与轻量级抓取生成模型解耦,以在复杂杂乱场景中实现多本体(multi-embodiment)语言引导抓取。当前前沿方向集中于利用VLM的零样本语义推理能力预测‘种子点’,作为高层指令与低层几何执行之间的高效接口,避免昂贵的端到端联合训练。与此关联的热点事件包括大规模合成数据集的构建——如SeededGrasp数据集首创性地提供了覆盖三种抓取器、超过250万次抓取姿态的杂乱桌面多本体抓取数据,填补了现有数据集在杂乱场景与多本体姿态同步缺失的空白。该数据集的重要意义在于推动了语言引导抓取系统从单一抓取器向多本体泛化的跨越,显著提升了在真实世界中应对复杂物体几何与密集遮挡的鲁棒性,为机器人通用操作能力的规模化发展奠定了关键数据基础。
相关研究论文
  • 1
    SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments多伦多大学; Vector Institute; 不列颠哥伦比亚大学; Google DeepMind · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务