遇见数据集

Coherent4D

收藏
arXiv2026-09-08 更新2026-09-10 收录
官方服务:

资源简介:

Coherent4D是一个大规模自我中心视频数据集,专为连续4D交互预测任务设计,由哈尔滨工业大学(深圳)、鹏城实验室和山东大学联合构建。数据集包含约23.3万条样本,覆盖烹饪、健康维护和自行车维修三个领域,每条样本同步提供未来3D交互位置序列与全身姿态序列,并在共享坐标系中建立时空对应关系。其创建过程基于Ego-Exo4D原始数据,通过统一采样、坐标对齐和姿态参数化生成,确保位置与运动的连续性与几何一致性。该数据集旨在突破现有方法将交互定位与人体运动分离预测的局限,为辅助机器人和人机交互等应用提供联合建模基础。

Coherent4D is a large-scale egocentric video dataset designed for continuous 4D interaction prediction tasks, jointly constructed by Harbin Institute of Technology (Shenzhen), Peng Cheng Laboratory, and Shandong University. The dataset contains approximately 233,000 samples spanning three domains: cooking, health maintenance, and bicycle maintenance. Each sample synchronously provides future 3D interaction position sequences and full-body pose sequences, and establishes spatiotemporal correspondences in a shared coordinate system. Its creation process is based on the raw data of Ego-Exo4D, and is generated through unified sampling, coordinate alignment, and pose parameterization, ensuring the continuity and geometric consistency of positions and motions. This dataset aims to break through the limitations of existing methods that separately predict interaction localization and human motion, providing a foundation for joint modeling in applications such as assistive robotics and human-computer interaction.

创建时间:
2026-09-08
原始信息汇总

From Where to How: 连续4D交互预测

数据集概述

本文提出了 Coherent4D 数据集,用于从第一人称视频中进行连续4D交互预测,同时预测未来交互在连续3D空间中的发生位置(where)以及全身动作实现方式(how)。

数据集规模与统计

  • 预测样本数:233,828个
  • 程序化任务数:21个
  • 独立拍摄数:787组
  • 物体类别数:535类

领域覆盖

领域 占比
Cooking(烹饪) 71.0%
Bike Repair(自行车维修) 17.2%
Health(健康/医疗) 11.8%

数据划分

领域 水平线(帧) Takes Train Val Test Total 目标数
Cooking 10 331 136,079 15,435 14,527 166,041 1,337,589
Health 5 205 21,532 1,899 4,167 27,598 114,964
Bike Repair 4 251 35,987 3,150 1,052 40,189 141,633
总计 787 193,598 20,484 19,746 233,828 1,594,186

注:Obj.列显示各领域物体类别数(Cooking: 428,Health: 170,Bike Repair: 197,总计535)。

动作动词多样性

常见操作原语包括:pick(拾取)、place(放置)、hold(握持)、drop(放下)、move(移动)、pour(倾倒)、turn(转动),且各领域呈现出互补的操作模式。

数据示例

每个样本将场景几何、语义物体范围、有序手部交互目标与时间对齐的SMPL全身姿态配对,在共享坐标系中呈现。时间线同时保留了目标物体和未来交互的度量演化信息。

方法框架(HIGFlow)

Hand-Interaction-Guided Residual Flow(手部交互引导残差流,HIGFlow) 以两阶段级联方式实现预测:

  1. 阶段1(Where):融合语义上下文(Qwen3-VL)与短时视觉动态(V-JEPA),预测连续的未来交互位置序列。
  2. 阶段2(How):利用预测的有序位置序列作为几何条件,引导确定性姿态锚点和有界残差Flow Matching,生成多样化且结构一致的全身运动预测。

实验结果

交互位置预测(毫米,越低越好)

在三个域上,HIGFlow在多数指标(ADE、ADE90、FDE)上均取得最优(加粗)或次优(下划线)结果,显著优于FIction、Qwen3-VL、V-JEPA、Diff-IP3D和MMTwin等基线方法。

全身姿态预测

在MPJPE和Root Trans.指标上,HIGFlow在Health、Bike Repair和Cooking三个域的单次(Single)与Best-5评估中均大幅优于其他基线;PA-MPJPE和Body Geo.指标在不同域上也取得最优或次优表现。

结论

Coherent4D提供了共享坐标系下时间对齐的交互位置与全身姿态序列,用于连续预测监督与评估;HIGFlow通过将未来交互位置作为姿态预测的几何条件,有效耦合了位置与姿态预测,在两类任务上均取得了显著改进。未来工作将探索人类意图建模和接触感知条件用于更长预测周期和更物理一致的预测。

搜集汇总
数据集介绍
Coherent4D 数据集图片
构建方式
该数据集基于Ego-Exo4D构建,涵盖烹饪、健康、自行车维修三个领域的233,828个样本。构建流程包括五个阶段:首先,利用Detic检测器识别物体并生成3D边界框,同时采用SLAM重建技术将二维检测提升至三维空间;其次,定义统一的样本局部坐标系,将场景、交互位置及身体姿态等所有空间量转换至该坐标系;再次,结合叙述时间戳、语言模型匹配及手物几何一致性,构建有序的连续3D交互位置序列;随后,使用WHAM重建全身姿态,并将SMPL状态与各交互时间戳对齐;最终,依据领域特定的预测视界划分数据,生成包含观测历史与未来目标的预测样本,并采用填充与有效性掩码处理不完整序列。
特点
该数据集的最大特色在于其耦合的4D监督信号,每个样本均包含时间对齐的连续3D交互位置序列与SMPL参数化的全身姿态序列,二者在共享的度量坐标系下保持空间与时间一致性。不同于以往离散体素或语义级别的表示,Coherent4D采用连续坐标回归,支持精确的几何评估。数据集规模庞大,覆盖535种交互物品种类,动作叙述多样,涵盖抓取、放置、倾倒等常见操作,同时针对不同领域设定差异化预测视界(4-10步)。此外,其构建流程严谨,确保坐标变换、姿态对齐和场景语义的可靠性,为连续4D交互预测提供了统一基准。
使用方法
该数据集适用于训练和评估从第一人称视频进行连续4D交互预测的模型。使用时,研究者输入30秒的观测片段(含30帧采样帧、环境描述、历史交互位置及姿态序列),预测未来特定步骤(如烹饪10步、健康5步、修车4步)的交互位置及对应全身姿态。训练阶段可采用两阶段级联范式:先预测位置序列,再以预测位置为条件生成姿态。评估指标包括交互位置的ADE、FDE,以及姿态的MPJPE、PA-MPJPE、根平移误差和身体测地线误差,支持多样性与结构一致性的比较。数据集按take级别划分训练/验证/测试集,确保环境隔离,便于直接复现实验。
背景与挑战
背景概述
Coherent4D数据集由哈尔滨工业大学(深圳)与鹏城实验室等机构的研究人员于2026年提出,旨在推动主动具身智能领域的发展。该数据集聚焦于从第一人称视角视频中连续预测未来4D交互位置与全身姿态的耦合问题,即“在何处交互”与“如何实现交互”的协同预测。研究团队基于Ego-Exo4D构建了包含约23.3万样本、跨越烹饪、健康与自行车维修三大领域的大规模数据集,每个样本均在同一坐标系下提供时空对齐的连续3D交互位置序列与SMPL全身姿态序列,为联合建模交互定位与运动实现提供了前所未有的基准,对辅助机器人、人机协作等领域具有重要影响力。
当前挑战
构建Coherent4D面临多重挑战。首要挑战在于解耦任务建模:现有方法将交互位置预测与姿态预测视为独立问题,缺乏时空几何对应约束。其次,现有数据集难以提供时间同步与空间对齐的连续交互位置和全身姿态序列,形成“时空配对鸿沟”。此外,语义定位鸿沟凸显了视觉语言模型在连续度量坐标回归上的不足,难以精准捕捉短期视觉动态。姿态预测则在多样性与结构一致性之间面临权衡,确定性方法抑制可行多样性,随机生成易破坏骨骼结构。数据构建中还需处理多视角坐标统一、时序对齐与大规模自动标注的质量控制等复杂工程问题。
常用场景
经典使用场景
Coherent4D数据集作为大规模第一视角视频理解领域的革新性资源,其最经典的使用场景在于推动连续4D交互预测的统一研究。该数据集创新性地将未来的三维交互位置与时间对齐的全身姿态配对,在共享坐标系统中提供连续且同步的监督信号,从而支持从观测视频中联合预测交互发生的空间位置及人体随之产生的运动模式。研究者可基于此数据集训练和评估集成的预测模型,以同时输出位置序列与姿态序列,打破传统上对这两个任务分离处理的局限,为具身智能体前瞻性规划提供数据支撑。
实际应用
在实际应用层面,Coherent4D所支撑的连续4D交互预测技术对于辅助机器人和人机交互系统具有显著价值。例如,在任务辅助场景中,系统能通过用户第一视角视频预判其下一步意图接触的目标物体及身体姿态,从而提前调整机械臂动作或提示信息;在风险预警应用中,可监测用户即将进行的危险动作,及时发出警示;在人类-机器人协作中,机器人能依据预测的交互位置与人体运动规划自身的协同路径。此外,该数据集的领域覆盖烹饪、健康检测与维修操作,也为智能穿戴设备的行为识别与主动干预提供了可靠的数据支撑,推动了具身智能在真实生活中的落地。
衍生相关工作
Coherent4D的提出催生了一系列承前启后的重要研究。一方面,它直接定义了连续4D交互预测的任务范式,启发了后续研究将交互定位与姿态预测作为联合优化目标,例如论文中提出的HIGFlow框架采用级联的where-to-how策略,先预测连续交互位置,再以其为条件生成全身运动,为耦合预测提供了高效解决方案。另一方面,该数据集引入的连续度量指标(如ADE、FDE、MPJPE等)成为后续研究的标准评估协议,促进了方法间的公平比较。此外,数据集的构建流程也为从Ego-Exo4D等原始视频中自动生成时空对齐监督信号提供了可复现的pipeline,推动了自动化数据标注技术的发展,后续工作可在此基础上扩展更多交互领域与更细粒度的肢体控制。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务