遇见数据集

Quad-Imaginarium

收藏
arXiv2026-06-27 更新2026-06-30 收录
官方服务:

资源简介:

Quad-Imaginarium是由阿里巴巴集团·高德团队创建的大规模四足机器人运动数据集,旨在解决传统动物运动捕捉数据稀缺、形态不匹配等问题。该数据集包含7,488条高质量3D参考运动轨迹,总时长18.5小时,涵盖杂技性和表演性行为,每条数据均配有语言标注和人工校正的动作标签。数据集通过创新的Uni-Mo流水线生成,结合大型语言模型提出运动描述、视频扩散模型合成机器人行为、并通过身份一致性损失确保生成质量,最终转化为可部署的跟踪策略。该数据集主要应用于四足机器人表达性运动生成、强化学习策略训练等领域,为突破传统运动数据局限提供了计算驱动的解决方案。

Quad-Imaginarium is a large-scale quadruped robot motion dataset developed by Alibaba Group’s Amap Team, aimed at addressing the issues of scarcity and morphological mismatch of traditional animal motion capture data. This dataset contains 7,488 high-quality 3D reference motion trajectories, with a total duration of 18.5 hours, covering acrobatic and performative behaviors. Each entry is equipped with linguistic annotations and manually corrected action labels. The dataset is generated through an innovative Uni-Mo pipeline, which combines large language models (LLMs) to generate motion descriptions, uses video diffusion models to synthesize quadruped robot behaviors, and leverages identity consistency loss to ensure the quality of generated outputs, ultimately being converted into deployable tracking policies. This dataset is primarily applied in fields such as expressive motion generation for quadruped robots and reinforcement learning policy training, providing a computation-driven solution to break through the limitations of traditional motion data.

创建时间:
2026-06-27
搜集汇总
数据集介绍
Quad-Imaginarium 数据集图片
构建方式
Quad-Imaginarium的构建摒弃了传统依赖动物运动捕捉或人工动捕的范式,转而采用一套全自动化的视频生成与运动提取流水线——Uni-Mo。该流水线首先利用大语言模型提出多样化的运动描述,并借助经LoRA微调的视频扩散模型Wan2.2,以固定参考图像为条件生成机器人运动视频。为解决生成视频中因身份漂移导致的刚体形变问题,研究提出身份一致性损失,通过DINOv2特征构建外观记忆库并施加铰链约束,确保每帧机器人的外观与结构稳定。随后,从高质量视频中利用2D关键点检测与基于URDF的运动学优化,将视频提升为19维的3D参考轨迹,并经由CLIP语义门、几何门和跟踪误差门三级筛选,最终保留了7,488条高质量运动片段。
特点
该数据集具有显著的多样性、表达性与可扩展性。与以往仅限于几种步态的运动捕捉数据集不同,Quad-Imaginarium涵盖了从翻滚、舞蹈到鞠躬、击掌等7,488种带有语言标注的杂技与表演类运动,总时长18.5小时。其运动范围在偏航总里程、俯仰范围、根节点Z轴范围、静态比例等六项运动学特征上全面超越现有数据集,尤其在俯仰范围等反映非运动类表达行为的维度上优势突出。每条运动均以19维状态向量形式存储,配有两种互补的语言标注——精细的运动描述与自然的指令。由于生成流水线完全自动化,数据集可随算力投入持续扩展,不受动物合作或人工采集的限制。
使用方法
用户可通过以下方式使用Quad-Imaginarium数据集:首先从公开仓库下载运动片段及对应的语言标注文件。每条运动以19维状态向量序列表示(3D根位置、四元数姿态及12个关节角度),可直接用于强化学习训练。研究团队已基于BeyondMimic框架为每条轨迹训练了PPO跟踪策略,在仿真中实现了97.6%的成功率。用户可在Unitree Go2实体机器人上复现验证——研究者随机抽取392条动作在真实机器人上执行,成功率达到96.7%。此外,数据集的语言标注还支持文本驱动的运动检索与生成,为后续研究提供即用基础。
背景与挑战
背景概述
Quad-Imaginarium数据集诞生于2026年,由阿里巴巴高德地图团队的研究者Youzhi Liu、Li Gao、Yifei Qian等人共同创建,旨在突破四足机器人运动表达能力的瓶颈。长期以来,四足机器人的行为库局限于行走、小跑、跳跃等少数步态,与公众所期望的富有表现力、类似伴侣动物的交互能力相去甚远。尽管人形机器人借助海量人体运动数据已能习得舞蹈、手势等丰富动作,四足机器人却因数据获取方式的根本性局限而停滞不前——传统方法依赖动物运动捕捉或视频重建,不仅受制于动物的配合程度、物种间的形态差异,还面临跨形态重定目标不适定问题。Quad-Imaginarium通过将数据稀缺重新定义为生成问题,彻底消除了动物介导环节,为四足机器人运动学习开辟了全新范式,对推动该类机器人从纯运动机器向情感化、交互式伴侣演进具有里程碑意义。
当前挑战
Quad-Imaginarium所应对的核心挑战在于突破四足机器人运动库的贫瘠现状,解决传统数据获取路径中动物依赖、重建脆弱、重定目标不适定这三重桎梏。具体而言,现有动物运动捕捉数据集受限于物种与行为多样性,无法覆盖表达性、陪伴导向的运动;基于视频的重建则因动物参数化模型SMAL的不成熟、变形表面与严重自遮挡而困难重重;即便重建成功,跨形态骨架的坐标映射也极易产生物理上不可行的运动。在数据集构建过程中,研究者面临视频生成中的“身份漂移”问题——当前扩散模型在长时程生成中会导致机器人刚性体非刚性变形、外观偏移与比例扭曲,破坏后续3D运动提取所需的刚体假设。为此,他们提出了身份一致性损失函数,通过帧间外观一致性约束确保生成视频中机器人身份稳定,并辅以多阶段质量过滤(CLIP语义门、几何门、跟踪误差门)来筛除不可靠轨迹,最终实现了从自然语言提示到可部署策略的全自动流水线。
常用场景
经典使用场景
Quad-Imaginarium的核心经典使用场景在于为四足机器人提供大规模、多样化的运动数据源,以突破传统仅依赖行走、小跑、跳跃等少量步态的运动瓶颈。该数据集通过全自动流水线Uni-Mo合成,包含7488段语言标注的运动剪辑,总时长18.5小时,覆盖从翻滚、鞠躬到舞蹈、后空翻等丰富表达性行为。研究人员可将其直接用于训练运动跟踪策略,在真实Unitree Go2机器人上实现96.7%的部署成功率。这一范式摆脱了对动物运动捕捉或手工设计的依赖,使得四足机器人运动获取成为随算力扩展的可解问题。
解决学术问题
Quad-Imaginarium解决了四足机器人领域长期存在的运动数据获取瓶颈问题。传统方法需借助动物中间体——从真实动物捕获运动、经物种特定三维重建(如SMAL模型)后跨形态重定向,这一过程受限于动物配合度、重建脆弱性及跨拓扑映射的病态性。该数据集创新性地将数据稀缺重构为生成问题,通过视频扩散模型直接合成机器人本体运动,避开了动物中间体引入的所有根本性缺陷。其配套的身份一致性损失(Identity Consistency Loss)有效解决了视频生成中的躯体漂移问题,为大规模、可扩展的具身运动学习奠定了方法论基础。
衍生相关工作
Quad-Imaginarium的出现推动了多项经典工作的衍生与发展。在视频生成领域,身份一致性损失的引入启发了面向具身智能的视频模型微调方法,后续工作探索了类似约束在操作任务与类人机器人运动生成中的应用。在运动学习方面,该数据集为风格奖励设计、对抗运动先验(AMP)的扩展训练、以及基于扩散策略的运动复用等方向提供了基准测试床。在跨形态迁移研究中,从生成视频直接提取机器人轨迹的范式被拓展至更复杂的运动规划与零样本迁移任务,催生了不依赖动物中间体的全新研究脉络。值得关注的是,该数据集填补了四足机器人表达性行为的数据鸿沟,为后续语言引导运动生成、大模型驱动的机器人技能库建设等方向铺平了道路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务