InterPet4D
收藏资源简介:
InterPet4D是由东京科学大学与卡内基梅隆大学联合创建的首个大规模多模态人宠交互4D数据集,旨在填补该领域高质量数据的空白。该数据集包含680万帧同步采集的多视角RGB视频、第一人称视角视频、音频轨道以及重建的三维运动数据,覆盖23位人类参与者与13只涵盖11个品种的犬只之间的自然交互行为。数据采集通过精心设计的12台同步相机阵列与智能眼镜系统完成,并采用标准化流程进行人体SMPL-X模型与犬类SMAL模型的三维重建与多模态标注。该数据集主要应用于跨物种行为分析、条件运动生成、社交机器人及虚拟角色动画等领域,为建模真实人宠交互动态关系提供了关键数据基础。
InterPet4D is the first large-scale multimodal 4D dataset for human-pet interaction jointly developed by Tokyo University of Science and Carnegie Mellon University, aiming to fill the gap of high-quality data in this field. This dataset contains 6.8 million frames of synchronously collected multi-view RGB videos, first-person perspective videos, audio tracks, and reconstructed 3D motion data, covering natural interactive behaviors between 23 human participants and 13 dogs encompassing 11 breeds. The data collection was completed through a meticulously designed 12-camera synchronized array and smart glasses system, and standardized procedures were employed for 3D reconstruction and multimodal annotation of human SMPL-X models and canine SMAL models. This dataset is primarily applied in fields including cross-species behavior analysis, conditional motion generation, social robotics, and virtual character animation, providing a critical data foundation for modeling the dynamic interactive relationships between humans and pets in real-world scenarios.
数据集概览:InterPet4D
InterPet4D 是一个多模态、以自我为中心的人类-宠物(狗)交互数据集。每个片段包含时间同步的音频、SMPL人体运动、MANO手部运动、宠物骨骼运动和SMAL宠物身体参数,支持跨物种交互、多模态运动生成、音频条件动画和动物行为理解等研究。
核心统计
- 交互会话:113个,覆盖13只狗(dog00–dog12)和约23名参与者(p01–p23)。
- 自我中心片段:227个,每个约17–20秒,使用头戴式眼镜(Project Aria风格)拍摄。
- 时间对齐模态:每个片段包含原始音频、MERT音频嵌入、SMPL人体、MANO手部、宠物骨骼和SMAL宠物身体拟合数据。
数据集结构
数据集根目录为 interpet4d_ver1/,包含以下子文件夹:
| 文件夹 | 格式 | 描述 |
|---|---|---|
interpet_audio/ |
.mp3 |
原始音频,48 kHz,立体声 |
interpet_mert/ |
.npy |
MERT预提取的音频嵌入,形状 (T_a, 1024),约75 Hz |
smpl_npy/ |
.npy (字典) |
SMPL人体参数,每个主体一个字典(如 aria01) |
mano_npy/ |
.npy (字典) |
MANO左右手参数,键值结构:{left: {...}, right: {...}} |
pet_npy/ |
.npy |
宠物(狗)3D关键点轨迹,形状 (T_p, 20, 4),最后一维 (x, y, z, score) |
smal_npy/ |
.npz |
SMAL宠物身体拟合,每帧参数随时间堆叠 |
文件命名规则
interpet_dog{DD}_p{PP}_take{TT}ego{NNN}.{mp3|npy}
{DD}:狗ID{PP}:参与者ID{TT}:轮次编号{NNN}:该轮次中的片段索引- 基本文件名(不含扩展名)为片段ID,在所有目录中通用,作为数据连接键。
模态详细规格
SMPL字典模式(键:主体ID,如 aria01)
global_orient:(T, 3),轴角根方向transl:(T, 3),根平移(米)body_pose:(T, 69),23个关节 × 3(轴角)betas:(T, 10),SMPL形状系数joints:(T, 45, 3),3D关节位置vertices:(T, 6890, 3),SMPL网格顶点epoch_loss:(T,),优化残差
MANO字典模式(每个手部)
joints:(T, 1, 21, 3),21个手部关键点(3D)pose:(T, 16, 3, 3),16个关节的旋转矩阵transl:(T, 3),手腕平移
SMAL字典模式(smal_npy/ 中 .npz 文件)
pose_rotmat:(T, 35, 3, 3),SMAL关节旋转(旋转矩阵)betas:(T, 30),SMAL形状系数betas_limbs:(T, 7),肢体特定形状系数R_world:(T, 3, 3),世界坐标系中的全局旋转t_world:(T, 3),世界坐标系中的全局平移(米)s_world:(T,),全局缩放因子kp_world:(T, 24, 3),世界坐标系中的24个关键点kp_weight:(T, 24),每个关键点的置信度权重frame_idx:(T,) int32,原始帧索引(可能稀疏/不连续)
备注:SMAL拟合覆盖226个片段(缺失1个);帧索引可能不连续,需用于与原始视频帧率对齐。所有模态按片段ID对齐;人体/手部/宠物运动以相同帧率
T采样,MERT以更高帧率T_a采样。
加载示例
- 通过
librosa和numpy加载:指定片段ID后,从各子文件夹加载对应文件。 - 通过
datasets库:from datasets import load_dataset; ds = load_dataset("<your-username>/interpet4d_ver1")
发布计划
- 当前
smal_npy/包含自动化管线生成的原始SMAL拟合。 - 未来更新将发布精炼/清理过的SMAL参数版本。
预期用途
- 跨物种(人类↔狗)交互建模
- 音频条件运动合成 / 声音到运动转换
- 动物行为的多模态表示学习
- 基于自我中心录制的4D场景理解
伦理考量
- 所有参与者提供知情同意书,允许数据发布。
- 不包含可识别个人身份的信息(旁观者的面部/声音)。
- 宠物福利:所有交互均在监督下进行,非强制性。
许可证
- CC BY-NC 4.0:仅限研究与非商业用途。商业用途需获得作者明确许可。
引用
请使用提供的BibTeX格式引用该数据集。
版本历史
- v1 (2026-06):初始发布,包含227个片段、13只狗、约23名参与者、四种时间对齐模态。




