遇见数据集

example-retargeted-motion-and-simulated-robot-execution-derived-from-taco

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

该数据集是基于TACO(大规模双手物体交互数据集)中人类操作演示的样本,通过重定位技术将其映射到双机器人Sharpa手部,并生成模拟机器人执行片段。数据集旨在展示Video to Data管道(一种将视频数据转换为机器人可执行数据的管道)的输出示例,方便用户实验该管道的接地部分或进行下游训练。数据为合成生成,包含三种模态:视频、运动轨迹和机器人动作。存储格式为Parquet和LeRobotv3。数据规模为:1,215个运动序列、121,500个机器人片段、1,215个运动Parquet文件,总存储量约924.8 GB。重定位运动数据包含2个特征,机器人数据包含8个特征。数据集由NVIDIA公司创建,发布于2026年8月1日,版本0.1。许可协议为CC-BY-4.0,允许商业和非商业用途。数据集还提供了伦理考虑声明,鼓励开发者确保符合行业和用例要求。

This dataset is based on samples of human manipulation demonstrations from TACO (a large-scale bimanual object interaction dataset), which are mapped to the dual-robot Sharpa hand via retargeting technology, generating simulated robot execution segments. The dataset aims to demonstrate output examples of the Video to Data pipeline (a pipeline that converts video data into robot-executable data), facilitating users to experiment with the grounding part of the pipeline or perform downstream training. The data is synthetically generated and includes three modalities: video, motion trajectories, and robot actions. The storage format is Parquet and LeRobotv3. The data scale is: 1,215 motion sequences, 121,500 robot segments, 1,215 motion Parquet files, with a total storage of approximately 924.8 GB. The retargeted motion data contains 2 features, and the robot data contains 8 features. The dataset was created by NVIDIA, released on August 1, 2026, version 0.1. The license is CC-BY-4.0, allowing commercial and non-commercial use. The dataset also provides an ethical considerations statement, encouraging developers to ensure compliance with industry and use case requirements.

提供机构:
NVIDIA
创建时间:
2026-08-07
原始信息汇总

数据集概述:Example Retargeted Motion and Simulated Robot Execution Derived from TACO

数据集基本信息

  • 所有者:NVIDIA Corporation
  • 创建日期:2026-08-01
  • 版本:0.1
  • 许可证:CC-BY-4.0(允许商业和非商业用途)
  • 任务类别:机器人(Robotics)
  • 数据规模:100G < n < 1T
  • 标签:机器人操作、双手操作、LeRobot、运动重定向、合成数据

数据集内容

本数据集包含两类核心数据:

  1. 重定向运动数据:将TACO数据集中的人类操作演示重定向至Sharpa双手机器人手部的运动序列
  2. 模拟机器人执行数据:模拟机器人模仿原始人类演示的执行片段

基础人类演示来源于TACO——一个大规模的双手手-物交互数据集。

预期用途

  • 演示Video to Data管道的示例输出
  • 支持用户便捷地实验管道中的grounding部分
  • 支持下游模型训练

数据特征

  • 采集方法:合成(Synthetic)
  • 标注方法:合成(Synthetic)
  • 模态:视频、运动轨迹、机器人动作
  • 格式:Parquet 和 LeRobotv3

数据量化统计

指标 数值
运动序列数 1,215
机器人执行片段数 121,500
运动Parquet文件数 1,215
重定向运动数据特征数 2
机器人数据特征数 8
总存储量 924.8 GB

参考资源

  • 相关代码仓库:https://github.com/nvidia-isaac/video_to_data/tree/main

伦理考量

NVIDIA鼓励开发者根据具体行业和应用场景评估数据集的适用性,并防范潜在的 misuse 风险。质量问题、安全漏洞或AI相关疑虑可通过NVIDIA官方安全提交渠道报告。

搜集汇总
数据集介绍
example-retargeted-motion-and-simulated-robot-execution-derived-from-taco 数据集图片
构建方式
在机器人灵巧操作研究领域,高质量示教数据的稀缺长期制约着策略学习与仿真迁移的进展。该数据集以TACO大规模双手手-物交互数据为源头,借助Video to Data grounding流水线,将人类演示视频中的手部运动重定向至双臂Sharpa机器人手模型,进而生成与原始人类演示相对应的机器人执行片段。构建过程融合了运动重定向与合成仿真技术,先提取人类演示的运动轨迹并映射为机器人可执行的关节动作,再通过仿真环境生成机器人执行数据,最终形成从人类视频到机器人动作的完整数据链条,涵盖运动序列、机器人回合与运动Parquet文件等多种形态。
特点
该数据集在规模与结构上均体现出显著优势,包含1215条运动序列、121500个机器人回合以及1215个运动Parquet文件,总存储量达924.8 GB,模态覆盖视频、运动轨迹与机器人动作。数据以Parquet和LeRobotv3格式组织,其中重定向运动数据含2个特征,机器人数据含8个特征,便于直接用于下游训练与实验。所有数据均为合成生成,标签亦为合成标注,来源可靠且经NVIDIA批准可用于商业与非商业用途,为双臂灵巧操作研究提供了可复现、可扩展的数据基础。
使用方法
该数据集面向Video to Data流水线的演示与实验需求,用户可借助其中的重定向运动样本,快速验证grounding环节的映射效果,亦可将机器人执行回合作为下游策略训练的输入。使用时可依据任务分类与标签筛选所需子集,结合LeRobotv3格式加载机器人动作数据,或读取Parquet文件获取运动轨迹信息。数据集附带GitHub参考链接,便于用户查阅流水线实现细节与使用示例,从而在仿真与真实机器人迁移研究中开展系统性的实验与评估。
背景与挑战
背景概述
机器人灵巧操作研究长期受制于高质量演示数据的稀缺,人类双手操作视频虽蕴藏丰富行为信息,却因手-物交互的复杂性与机器人本体运动学的异构性而难以直接迁移。NVIDIA于2026年发布的example-retargeted-motion-and-simulated-robot-execution-derived-from-taco数据集,以TACO大规模双手手-物交互数据集为源,经由Video to Data管线将人类演示重定向至双臂Sharpa机器人手,并生成仿真执行片段。该数据集涵盖1,215条运动序列与121,500条机器人执行轨迹,旨在为视觉到数据落地管线提供可复现的示例输出与下游训练资源,对推动跨本体操作技能迁移与合成数据规模化生成具有参考意义。
当前挑战
该数据集所面向的领域问题在于,如何将非结构环境中的双手人类操作演示忠实地映射为机器人可执行的灵巧动作,进而突破真实机器人数据采集成本高昂、覆盖任务有限的瓶颈。构建过程亦面临多重挑战:人类与机器人手在自由度配置、关节限位及接触动力学上的显著差异,使运动重定向需在保持操作语义的同时满足物理可行性;从视频中恢复三维手-物交互并生成稠密动作序列,对视觉估计精度与时序一致性提出严苛要求;仿真执行与原始演示之间可能存在的分布偏移,也影响合成数据的真实性与下游策略学习效果。
常用场景
经典使用场景
在具身智能与机器人操作学习领域,双臂灵巧操作技能的获取长期依赖真实机器人遥操作或动捕设备,成本高昂且难以规模化。该数据集将TACO大规模人手-物体交互演示重定向至Sharpa双臂机器人手,并借助Video to Data管线生成机器人执行片段,为研究者提供了一个从人类视频到机器人动作的完整验证平台。其最经典的使用场景在于:用户可直接调用重定向动作数据来实验Video to Data的接地(grounding)流程,或将生成的机器人执行轨迹用于下游模仿学习与策略训练,从而在无需搭建真实硬件的情况下完成从视频理解到动作生成的闭环验证。
解决学术问题
该数据集直面机器人学习领域中演示数据稀缺与跨具身迁移困难两大核心问题。传统方法受限于真实机器人采集的高昂成本,难以获得覆盖多样物体与操作技能的大规模演示,导致模仿学习策略泛化能力不足。通过将TACO中丰富的人手操作演示重定向为双臂机器人动作,并配套生成仿真执行片段,该数据集为跨具身动作映射、视觉-动作联合建模以及仿真到现实的迁移研究提供了标准化基准。其意义在于打通了从人类视频到机器人可执行数据的转化路径,降低了具身智能研究的准入门槛,并为验证重定向算法与策略学习效果提供了可复现的数据基础。
衍生相关工作
围绕该数据集,已衍生出一系列与Video to Data管线及双臂操作相关的研究工作。基于NVIDIA Isaac平台构建的video_to_data开源工具链,推动了从人类视频中提取手物交互信息并转化为机器人可执行动作的算法发展。以TACO原始数据集为基础的重定向方法研究,促进了跨具身运动映射与手部姿态估计技术的进步。此外,该数据集所采用的LeRobotv3格式与Parquet存储方案,也为机器人学习社区的数据标准化与共享提供了参考,激励了后续在双臂灵巧操作、仿真数据增强以及视频驱动策略学习等方向的探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务