遇见数据集

InterPet4D

收藏
arXiv2026-07-11 更新2026-07-14 收录
官方服务:

资源简介:

InterPet4D是由东京科学大学与卡内基梅隆大学联合创建的首个大规模多模态人宠交互4D数据集,旨在填补该领域高质量数据的空白。该数据集包含680万帧同步采集的多视角RGB视频、第一人称视角视频、音频轨道以及重建的三维运动数据,覆盖23位人类参与者与13只涵盖11个品种的犬只之间的自然交互行为。数据采集通过精心设计的12台同步相机阵列与智能眼镜系统完成,并采用标准化流程进行人体SMPL-X模型与犬类SMAL模型的三维重建与多模态标注。该数据集主要应用于跨物种行为分析、条件运动生成、社交机器人及虚拟角色动画等领域,为建模真实人宠交互动态关系提供了关键数据基础。

InterPet4D is the first large-scale multimodal 4D dataset for human-pet interaction jointly developed by Tokyo University of Science and Carnegie Mellon University, aiming to fill the gap of high-quality data in this field. This dataset contains 6.8 million frames of synchronously collected multi-view RGB videos, first-person perspective videos, audio tracks, and reconstructed 3D motion data, covering natural interactive behaviors between 23 human participants and 13 dogs encompassing 11 breeds. The data collection was completed through a meticulously designed 12-camera synchronized array and smart glasses system, and standardized procedures were employed for 3D reconstruction and multimodal annotation of human SMPL-X models and canine SMAL models. This dataset is primarily applied in fields including cross-species behavior analysis, conditional motion generation, social robotics, and virtual character animation, providing a critical data foundation for modeling the dynamic interactive relationships between humans and pets in real-world scenarios.

创建时间:
2026-07-11
原始信息汇总

数据集概览:InterPet4D

InterPet4D 是一个多模态、以自我为中心的人类-宠物(狗)交互数据集。每个片段包含时间同步的音频SMPL人体运动MANO手部运动宠物骨骼运动SMAL宠物身体参数,支持跨物种交互、多模态运动生成、音频条件动画和动物行为理解等研究。

核心统计

  • 交互会话:113个,覆盖13只狗(dog00–dog12)和约23名参与者(p01–p23)。
  • 自我中心片段:227个,每个约17–20秒,使用头戴式眼镜(Project Aria风格)拍摄。
  • 时间对齐模态:每个片段包含原始音频、MERT音频嵌入、SMPL人体、MANO手部、宠物骨骼和SMAL宠物身体拟合数据。

数据集结构

数据集根目录为 interpet4d_ver1/,包含以下子文件夹:

文件夹 格式 描述
interpet_audio/ .mp3 原始音频,48 kHz,立体声
interpet_mert/ .npy MERT预提取的音频嵌入,形状 (T_a, 1024),约75 Hz
smpl_npy/ .npy (字典) SMPL人体参数,每个主体一个字典(如 aria01
mano_npy/ .npy (字典) MANO左右手参数,键值结构:{left: {...}, right: {...}}
pet_npy/ .npy 宠物(狗)3D关键点轨迹,形状 (T_p, 20, 4),最后一维 (x, y, z, score)
smal_npy/ .npz SMAL宠物身体拟合,每帧参数随时间堆叠

文件命名规则

interpet_dog{DD}_p{PP}_take{TT}ego{NNN}.{mp3|npy}

  • {DD}:狗ID
  • {PP}:参与者ID
  • {TT}:轮次编号
  • {NNN}:该轮次中的片段索引
  • 基本文件名(不含扩展名)为片段ID,在所有目录中通用,作为数据连接键。

模态详细规格

SMPL字典模式(键:主体ID,如 aria01

  • global_orient: (T, 3),轴角根方向
  • transl: (T, 3),根平移(米)
  • body_pose: (T, 69),23个关节 × 3(轴角)
  • betas: (T, 10),SMPL形状系数
  • joints: (T, 45, 3),3D关节位置
  • vertices: (T, 6890, 3),SMPL网格顶点
  • epoch_loss: (T,),优化残差

MANO字典模式(每个手部)

  • joints: (T, 1, 21, 3),21个手部关键点(3D)
  • pose: (T, 16, 3, 3),16个关节的旋转矩阵
  • transl: (T, 3),手腕平移

SMAL字典模式(smal_npy/.npz 文件)

  • pose_rotmat: (T, 35, 3, 3),SMAL关节旋转(旋转矩阵)
  • betas: (T, 30),SMAL形状系数
  • betas_limbs: (T, 7),肢体特定形状系数
  • R_world: (T, 3, 3),世界坐标系中的全局旋转
  • t_world: (T, 3),世界坐标系中的全局平移(米)
  • s_world: (T,),全局缩放因子
  • kp_world: (T, 24, 3),世界坐标系中的24个关键点
  • kp_weight: (T, 24),每个关键点的置信度权重
  • frame_idx: (T,) int32,原始帧索引(可能稀疏/不连续)

备注:SMAL拟合覆盖226个片段(缺失1个);帧索引可能不连续,需用于与原始视频帧率对齐。所有模态按片段ID对齐;人体/手部/宠物运动以相同帧率 T 采样,MERT以更高帧率 T_a 采样。

加载示例

  • 通过 librosanumpy 加载:指定片段ID后,从各子文件夹加载对应文件。
  • 通过 datasets 库:from datasets import load_dataset; ds = load_dataset("<your-username>/interpet4d_ver1")

发布计划

  • 当前 smal_npy/ 包含自动化管线生成的原始SMAL拟合。
  • 未来更新将发布精炼/清理过的SMAL参数版本。

预期用途

  • 跨物种(人类↔狗)交互建模
  • 音频条件运动合成 / 声音到运动转换
  • 动物行为的多模态表示学习
  • 基于自我中心录制的4D场景理解

伦理考量

  • 所有参与者提供知情同意书,允许数据发布。
  • 不包含可识别个人身份的信息(旁观者的面部/声音)。
  • 宠物福利:所有交互均在监督下进行,非强制性。

许可证

  • CC BY-NC 4.0:仅限研究与非商业用途。商业用途需获得作者明确许可。

引用

请使用提供的BibTeX格式引用该数据集。

版本历史

  • v1 (2026-06):初始发布,包含227个片段、13只狗、约23名参与者、四种时间对齐模态。
搜集汇总
数据集介绍
InterPet4D 数据集图片
构建方式
InterPet4D数据集依托一个精心设计的多模态采集系统构建而成。该采集环境为一个6米×6米的正方形区域,部署了12台同步的GoPro Hero13相机(1920×1080,60fps),其中8台相机被放置于较低位置以优化对宠物及人类手部的捕捉视角。同时,每位参与者佩戴一副Ray-Ban Meta眼镜,用以录制第一人称视角的RGB视频及音频。所有设备通过软件对齐,同步误差控制在一帧以内。数据集涵盖了23名人类参与者与13只不同品种的狗之间的自然交互,共记录了161个会话,总计683万帧同步数据。交互动作被系统化地划分为抚摸、指令、呼唤和自由形式四大类别,确保了交互行为的多样性与结构化。
特点
InterPet4D数据集具有多项突出特点。首先,它是首个提供人与宠物交互的同步多模态4D数据集,不仅包含多视角与自我中心视角的RGB视频,还提供了基于SMPL-X、MANO和SMAL模型重建的高质量人体(全身及手部)与狗的3D运动数据。其次,数据集覆盖了13只来自11个品种的犬类,体型差异显著,并包含了音频声道及通过大模型自动生成的文本标注,使得人机交互的语音与动作模态得以联合建模。此外,所有数据均经过严格的后处理,包括2D/3D关键点三角化、时域平滑优化及模型拟合,确保了数据在几何和时间上的一致性。
使用方法
InterPet4D数据集适用于多种科学研究场景,尤其在人与宠物交互的生成模型研究中具有重要价值。用户可通过Hugging Face平台获取原始多视角视频、自我中心视角视频、对齐音频以及重建的3D人体与宠物运动数据。数据集提供了固定的80:20训练/验证划分。研究人员可以利用该数据集训练类似于InterPetMoGen的扩散或自回归模型,以人体动作和音频为条件生成合理的宠物运动响应。此外,数据集丰富的模态信息亦可支撑宠物姿态估计、人宠交互行为分析、跨物种运动生成等下游任务。
背景与挑战
背景概述
在人机交互与计算机视觉领域,跨物种行为建模长期受限于高质量多模态数据集的匮乏。2026年,东京科学大学与卡内基梅隆大学的研究团队携手发布了InterPet4D数据集,旨在填补人类与宠物(犬类)细粒度交互研究的数据空白。该数据集由Yichen Peng、Jyun-Ting Song等学者主导,通过12台同步多视角摄像机与第一人称眼镜采集了23名参与者与13只犬(涵盖11个品种)的683万帧交互数据,涵盖抚摸、指令、呼唤及自由互动四大类别。数据集不仅提供了多视角RGB视频、音频及精确的3D人体与犬类运动标注,还首创性地整合了视听双模态信号,为理解跨物种协调行为提供了前所未有的基准。其发布迅速引发领域关注,被视为推动社会感知机器人、虚拟角色动画及行为分析研究的关键基石。
当前挑战
InterPet4D所解决的领域核心挑战在于从多模态输入中生成符合语义且动作真实的宠物运动响应。由于犬类行为具有天然非确定性,同一人类指令可能对应多种合理反应,这要求模型学习条件概率分布而非单一映射。此外,跨物种交互中严重的人犬遮挡问题挑战了精细姿态重建的鲁棒性。在构建过程中,团队面临多重技术瓶颈:如何实现多视角摄像机、音频与第一人称视频的亚帧级同步;如何设计涵盖不同体型、训练背景犬类的标准化交互协议;以及如何从强遮挡、稀疏视角下通过概率优化与骨骼约束稳定重建犬类3D姿态与变形体模型。这些挑战的攻克不仅验证了数据集的实用价值,也为后续跨物种交互研究奠定了方法论基础。
常用场景
经典使用场景
InterPet4D作为首个大规模多模态人宠交互4D数据集,为跨物种行为建模提供了前所未有的数据基础。其最经典的使用场景在于人类手势与语音指令驱动的宠物运动生成任务——研究者可基于该数据集中同步采集的多视角RGB视频、第一人称视角影像、音频命令及3D人体与犬只姿态标注,训练条件式运动生成模型。典型范式是给定一段包含人体全身动作、手部精细运动及语音指令的输入序列,模型需输出符合交互逻辑的犬只3D运动轨迹,涵盖坐、转、跳跃等驯服指令响应以及自由互动中的自然行为。该场景突破了传统仅限单人或多人的运动生成范畴,开创了跨形态、跨智能体的运动合成新方向。
实际应用
在实际应用层面,InterPet4D展现出了广阔的技术转化前景。在数字娱乐领域,该数据集可用于生成虚拟宠物与玩家的实时交互动画,使游戏或元宇宙中的犬只角色能够根据用户的手势和语音做出逼真的动作反馈,显著提升沉浸式体验的细腻程度。在社交机器人方向,数据集为设计具备跨物种沟通能力的机器人提供了行为模板——使宠物陪伴机器人能够理解人类主人的肢体语言并生成相应的犬类回应。在辅助疗愈和动物行为分析中,InterPet4D支撑的生成模型可协助训练师可视化不同指令下犬只的理想反应模式,或为宠物医学行为评估提供标准化的运动参照基线,赋能动物福祉研究。
衍生相关工作
围绕InterPet4D,研究者已衍生出多项经典工作。论文本身提出的InterPetMoGen框架率先将MotionGPT架构引入跨物种运动生成领域,通过PetVAE运动分词器将犬只姿态离散化为可组合的令牌,并设计模态感知注意力机制实现从人体全身到手部再到语音的多层级条件控制。该工作激发了后续对异质运动表征对齐的研究,例如探索如何将SMAL动物体模型与SMPL人体模型在共享潜在空间中映射。此外,数据集中多视角与自视角的同步影像催生了基于交叉注意力的人宠遮挡感知重建方法,而音频与运动标注则推动了语音驱动宠物响应生成方向的探索——研究者们尝试将条件扩散模型与离散化运动编码相结合,进一步提升了生成运动的多样性与真实感。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务