DexGraspNet 3.0
收藏资源简介:
DexGraspNet 3.0 是一个大规模的合成灵巧抓握数据集,包含 1.74 亿个与语义部分映射的灵巧抓握姿态,覆盖了 17.4 万个对象,并配有详细的分部分描述。该数据集通过高效的抓握合成流程生成,并结合了 SAMesh 和 GPT-4o 等先进模型进行部分分割和描述。DexGraspNet 3.0 用于训练 DexVLG 模型,该模型能够生成与语言指令对齐的通用抓握姿态,并在模拟和真实世界的实验中取得了优异的性能。
DexGraspNet 3.0 is a large-scale synthetic dexterous grasping dataset. It contains 174 million dexterous grasping poses mapped to semantic parts, covering 174,000 objects, with detailed per-part descriptions. This dataset is generated via an efficient grasping synthesis pipeline, and incorporates advanced models such as SAMesh and GPT-4o for part segmentation and description generation. DexGraspNet 3.0 is designed for training the DexVLG model, which can generate language-aligned general-purpose grasping poses and achieves excellent performance in both simulation and real-world experiments.
DexVLG: Dexterous Vision-Language-Grasp Model at Scale
基本信息
- 发表会议:ICCV 2025
- 作者:Jiawei He1,2, Danshi Li2, Xinqiang Yu*2, Zekun Qi2,3, Wenyao Zhang2,6,7, Jiayi Chen2,4, Zhaoxiang Zhang†5, Zhizheng Zhang†2, Li Yi†3, He Wang†1,2,4
- 机构:BAAI, Galbot, THU, PKU, CASIA, SJTU, EIT
- 论文:arXiv:2507.02747
- 代码:未提供具体链接
主要贡献
- 构建了大规模合成灵巧抓取数据集DexGraspNet3.0,包含带描述的抓取姿势(描述抓取部位和风格)。
- 基于DexGraspNet3.0数据集训练了语言指令抓取姿势预测模型DexVLG,该模型能在真实实验中为不同物体生成语言对齐且可泛化的抓取姿势。
数据集详情
- 名称:DexGraspNet 3.0
- 规模:1.7亿个灵巧抓取姿势
- 覆盖对象:174,000个
- 数据特性:映射到语义部位的抓取姿势,带有详细部位级描述
模型性能
- 零样本泛化能力:超过76%的执行成功率
- 仿真测试:在部位抓取准确率上达到state-of-the-art
- 真实场景:成功实现部位对齐抓取
技术特点
- 输入:单视角RGBD
- 架构:结合VLM和基于flow-matching的姿势头
- 功能:生成与语言指令对齐的桌面物体抓取姿势
引用格式
bibtex @article{dexvlg25, title={DexVLG: Dexterous Vision-Language-Grasp Model at Scale}, author={He, Jiawei and Li, Danshi and Yu, Xinqiang and Qi, Zekun and Zhang, Wenyao and Chen, Jiayi and Zhang, Zhaoxiang and Zhang, Zhizheng and Yi, Li and Wang, He}, journal={arXiv preprint arXiv:2507.02747}, year={2025} }

- 1DexVLG: Dexterous Vision-Language-Grasp Model at ScaleBAAI, Galbot, THU, PKU, CASIA, SJTU, EIT · 2025年



