遇见数据集

harmony4d-flattened

收藏
Hugging Face2026-08-04 更新2026-08-05 收录
官方服务:

资源简介:

harmony4d-flattened 是一个基于 Harmony4D 多摄像头 3D 动捕数据构建的文本-动作对数据集。原始数据集中,用户侧描述缺少指令动词,且 VLM 生成的描述未使用结构化的 <caption> 标签。本数据集对其进行改进:1) 在类别句子后添加 <caption> 标签包裹 VLM 描述;2) 前向任务(文本→动作)使用 4 种指令动词模板之一(如“Create some actions for one of the agents that embodies this text: ...”),替代原有的裸描述;3) 新增反向任务(动作→文本),给定相同的 <agent> 动作令牌,用文字描述动作,使用 4 种指令池。数据集共 16,640 行(8,320 原始行 × 2 个任务),仅包含训练集分割,之前的测试集未保留。数据格式为 ChatML,每条记录包含用户输入和助手输出,其中动作令牌由 <agent>...</agent> 包裹。数据集特征包括:id(字符串)、source_id(字符串)、task(字符串,指示前向或反向任务)、tier(字符串,如 ChatML)、text(字符串,完整对话文本)。该数据集适用于指令微调多模态模型,特别是需要理解文本生成动作或从动作生成描述的任务。

harmony4d-flattened is a text-action pair dataset built from the Harmony4D multi-camera 3D motion capture data. In the original dataset, user-side descriptions lack instruction verbs, and VLM-generated descriptions do not use structured <caption> tags. This dataset improves upon it by: 1) adding <caption> tags wrapping VLM descriptions after category sentences; 2) using one of four instruction verb templates for the forward task (text→action), such as Create some actions for one of the agents that embodies this text: ..., replacing the original bare descriptions; 3) adding a reverse task (action→text), given the same <agent> action tokens, describing actions in words using four instruction pools. The dataset contains 16,640 rows (8,320 original rows × 2 tasks), only including the training split; the previous test set is not retained. The data format is ChatML, with each record containing user input and assistant output, where action tokens are wrapped by <agent>...</agent>. Dataset features include: id (string), source_id (string), task (string indicating forward or reverse task), tier (string, e.g., ChatML), text (string, complete conversation text). This dataset is suitable for instruction fine-tuning of multimodal models, especially tasks requiring understanding text to generate actions or generating descriptions from actions.

创建时间:
2026-07-23
原始信息汇总

数据集概述:harmony4d-flattened

数据集标识

  • 名称:harmony4d-flattened
  • 发布机构:EmpathicRobotics
  • 许可证:CC-BY-4.0
  • 数据集主页:https://huggingface.co/datasets/EmpathicRobotics/harmony4d-flattened

数据集规模与结构

  • 数据集大小:4,575,111,807 字节(约 4.58 GB)
  • 下载大小:1,623,161,104 字节(约 1.62 GB)
  • 样本总数:16,640 条(8,320 条源数据 × 2 个任务)
  • 划分方式:仅包含 train 划分,无测试集(此前的 train/test 划分已废弃,原测试集未保留)

数据特征(Features)

每条数据包含以下字段:

字段名 数据类型 说明
id string 唯一标识符
source_id string 源数据标识
task string 任务类型(forwardreverse
tier string ChatML 层级
text string 完整对话文本(含指令、描述与动作令牌)

数据集背景与设计动机

  • 问题来源:早期版本中,用户侧仅包含无指令动词的纯描述,模型未被明确告知这是“文本→动作”任务;同时,真实 VLM 字幕被拼接在固定类别句子后,缺乏结构标记(如 <caption> 标签),与其他数据源不一致。
  • 改进目标:通过添加指令动词、引入 <caption> 标签、新增反向任务,使数据更适合文本与动作之间的双向映射学习。

具体改动内容

  1. <caption> 包装:将类别描述与 VLM 字幕用 <caption> 标签包裹,格式为:{类别句子} <caption>{VLM字幕}</caption>
  2. 前向任务(forward,文本→动作)增强:类别与字幕描述被封装进 4 种指令动词模板之一(按记录哈希选择),例如:“Create some actions for one of the agents that embodies this text: ...”。
  3. 新增反向任务(reverse,动作→文本):给定相同的 <agent> 动作令牌,要求用文字描述该动作,同样采用 4 种指令模板,例如:“Given these actions of a single agent, describe the action. ...”。此任务可行是因为 <agent> 具有确定性解码器(PCHIP 可精确重建 3D 姿态),与种子数据集中生成式重建不同,后者因不可验证而被拒绝。

数据格式示例(ChatML 层级)

前向任务(forward)

<|im_start|>user Create some actions for one of the agents that embodies this text: Two people hugging each other. <caption>The two individuals are participating in a motion-capture session for a film or video production.</caption><|im_end|> <|im_start|>assistant <think> </think> <agent> ...tokens... </agent><|im_end|>

反向任务(reverse)

<|im_start|>user Given these actions of a single agent, describe the action. <agent>...</agent><|im_end|> <|im_start|>assistant <think> </think> Two people hugging each other. <caption>...</caption><|im_end|>


底层数据来源

  • Harmony4D:真实多相机 3D 动作捕捉数据。
  • 动作令牌:由 MotionBERT/HRNet 生成。
  • VLM 字幕:由 Qwen2.5-VL-3B 模型生成。
  • 基础版本:此数据集为此前单任务版本(窗口=8,8,320 行,含 train/test 划分)的替代品,旧内容不再使用。

未尝试的扩展(明确声明)

  • 多轮对话式问答
  • 基于身体部位的动作推理

这两项因需要额外的 LLM 生成步骤而暂未实现,属于后续计划。

搜集汇总
数据集介绍
harmony4d-flattened 数据集图片
构建方式
harmony4d-flattened数据集的构建基于Harmony4D真实多相机3D动作捕捉数据,通过MotionBERT/HRNet提取代理令牌,并利用Qwen2.5-VL-3B生成场景描述。该数据集在原有基础上进行了结构化增强,为每条记录添加了<caption>标记以明确区分类别句子与视觉描述,并引入了两种任务模板:正向任务将文本描述与指令动词结合,生成动作令牌;反向任务则根据动作令牌生成文本描述。两种任务各占一半,共16,640条训练样本,采用ChatML格式组织对话层级,确保数据结构的统一性与可解析性。
特点
该数据集的核心特点在于其双向任务设计,不仅支持文本到动作的生成,还创新性地实现了动作到文本的反向描述,这得益于代理令牌具有确定性解码器,能够精确重建3D姿态。不同于以往单一任务版本,此次发布统一了训练集,摒弃了早前的测试集划分,体现了对数据分布的重新优化。此外,指令动词的多样化模板(4种变体)通过哈希选取,增强了模型对任务指令的泛化能力,同时保留了原始动作令牌的字节级一致性,确保了数据质量的稳定。
使用方法
使用方法上,研究者可直接加载该数据集的训练分割,利用ChatML格式的对话样本进行模型微调。正向任务适用于训练文本条件动作生成模型,而反向任务则可用于动作理解与描述生成。数据集的设计便于直接输入到基于Transformer的生成架构中,无需额外预处理。值得注意的是,当前版本不包含对话式多轮推理或分段运动分析,这些功能需通过后续LLM生成步骤扩展。基准模型可参考EmpathicRobotics/harmony4d-flattened的生产级单任务版本,以实现对比评估。
背景与挑战
背景概述
harmony4d-flattened数据集由EmpathicRobotics团队于2026年发布,基于Harmony4D真实多相机3D动作捕捉数据构建,旨在弥合自然语言指令与智能体动作生成之间的鸿沟。该数据集的核心研究问题在于如何将文本描述与动作令牌序列进行精确映射,通过引入指令动词和结构化标记(如<caption>标签),强化了模型对文本到动作任务的理解。其前身已在多模态动作生成领域产生影响力,而此次更新通过增加逆向任务和指令模板,进一步提升了数据集的实用性与任务多样性,为具身智能体的动作生成研究提供了高质量的训练资源。
当前挑战
该数据集面临的挑战包括:一是领域问题层面,文本到动作生成需解决语义歧义和动作细粒度对应难题,尤其是准确捕捉复杂交互动作(如拥抱)的时空动态;二是构建过程中,需确保动作令牌的确定性解码(如PCHIP重建)以保证逆向任务的可行性,同时避免因生成式重建的不可验证性而引入噪声;此外,在格式统一上,需为每条记录匹配哈希选择的指令模板,并处理多视角3D数据与VLM标注的融合,以维持前后一致性并规避训练分布偏移,这些要求对数据规模、标注精度和计算资源提出了高门槛。
常用场景
经典使用场景
harmony4d-flattened数据集的核心应用在于人机交互与具身智能领域的多模态动作-语言对齐训练。该数据集整合了来自Harmony4D的真实多视角三维动作捕捉数据,并辅以VLM生成的语义标注,构建了包含文本指令、情境描述与动作令牌的三元组结构。其经典使用场景是利用指令-动词模板与<caption>标记,训练模型将自然语言描述转化为具体的动作序列,或反向从动作序列中生成语义描述,为多模态大模型赋予动作理解与生成能力。
解决学术问题
此数据集针对动作-语言映射中的两大关键问题提供了解决方案:其一,改进了跨模态指令的语义明晰度,通过引入结构化指令动词,解决了先前数据中用户指令缺失动作意图的问题;其二,创新性地引入逆向任务,解决了动作描述的可验证性问题。该数据集为文本到动作生成、动作到文本描述及跨模态零样本学习等学术难题提供了高质量的标准化训练语料,推动了多模态推理与具身智能基础模型的发展。
衍生相关工作
基于该数据集,研究者可衍生出多项经典工作,包括基于指令的多模态动作生成大模型、动作-语言联合嵌入模型、跨模态检索系统及可控动作合成框架。其指令模板与<caption>结构可启发人机对话中的意图理解研究,而逆向任务的确定性解码机制则为动作重建与验证提供了新思路。此数据集有望成为Text-to-Motion、Motion-to-Text及多模态具身智能领域的重要基准,催生更多创新性算法与应用的诞生。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务