遇见数据集

synthetic-human-expressions-poses-3d

收藏
Hugging Face2026-06-18 更新2026-06-19 收录
官方服务:

资源简介:

3D合成人体姿势与FACS表情数据集是一个高保真合成数据集,包含10,075对3D人体角色渲染图像和详细的自然语言标注。该数据集使用单一基础3D人体模型生成,通过广泛的身体姿势、面部表情和相机角度变化实现多样性。除了标准的文本-图像对外,数据集还包含详细的3D元数据(精确的相机坐标、焦距和基于FACS的面部混合形状强度)以及来自CLIP ViT模型和OpenCV ResNet-10 SSD人脸检测器的验证诊断。数据集经过严格筛选,根据视觉对齐度、CLIP分数和人脸存在情况分为四个子目录:with_face(5,285对,高CLIP分数且检测到人脸)、without_face(2,287对,高CLIP分数未检测到人脸且文本中未提及面部)、mismatch(1,238对,高CLIP分数但文本提及面部却未检测到人脸)和low_quality(1,265对,CLIP对齐分数低于阈值)。每个类别文件夹包含.jpg渲染图像、.txt文本描述、dataset_log.json(原始3D生成日志)和report_partial.json(验证报告)。该数据集适用于姿势引导生成(ControlNet/IP-Adapter)、面部表情训练(FACS控制)以及多模态整理等任务,可用于训练模型识别从描述性文本直接提取的动作单元(FACS)。数据集采用CC BY 4.0许可证发布。

The 3D Synthetic Human Pose and FACS Expression Dataset is a high-fidelity synthetic dataset containing 10,075 pairs of 3D human character rendered images and detailed natural language annotations. Generated using a single base 3D human model, the dataset achieves diversity through extensive variations in body poses, facial expressions, and camera angles. In addition to standard text-image pairs, the dataset also includes detailed 3D metadata (precise camera coordinates, focal length, and FACS-based facial blend shape intensities), as well as validation diagnostics from the CLIP ViT model and OpenCV ResNet-10 SSD face detector. The dataset is strictly filtered and divided into four subdirectories based on visual alignment, CLIP scores, and the presence of human faces: with_face (5,285 pairs, high CLIP score with detected human faces), without_face (2,287 pairs, high CLIP score without detected human faces and no facial mentions in the text), mismatch (1,238 pairs, high CLIP score but the text mentions facial features while no human faces are detected), and low_quality (1,265 pairs, CLIP alignment score below the threshold). Each category folder includes .jpg rendered images, .txt text descriptions, dataset_log.json (original 3D generation log), and report_partial.json (validation report). This dataset is suitable for tasks such as pose-guided generation (ControlNet/IP-Adapter), facial expression training (FACS control), and multimodal curation, and can be used to train models to recognize action units (FACS) directly extracted from descriptive text. The dataset is released under the CC BY 4.0 license.

创建时间:
2026-06-18
原始信息汇总

数据集概述

  • 数据集名称: 3D Synthetic Human Poses and FACS Expressions Dataset
  • 数据集规模: 10,075 对(图片-文本对),文件数量超过 20,000 个,解压后占用磁盘空间小于 100 MB。
  • 许可证: Creative Commons Attribution 4.0 International (CC BY 4.0),可商用和研究使用。
  • 任务类型: 文本到图像、图像到文本、图像分类。
  • 标签: 合成数据、3D图形、人体姿态估计、面部表情、FACS、CLIP过滤。

数据生成与结构

  • 基础模型: 使用单一基础3D人体模型生成,保证一致性。
  • 多样性来源: 通过变化身体姿态、面部表情和相机角度实现多样性。
  • 相机设置: 相机围绕主体旋转,从多个视角和角度捕捉角色。
  • 生成变量: 10,075 种独特的身体姿态与面部表情组合。

数据集划分与文件内容

数据集经过严格筛选,根据视觉对齐、CLIP分数和面部检测结果分为四个子目录:

  1. with_face/ (5,285 对)

    • CLIP 分数 ≥ 0.25 且成功检测到人脸。
    • 适用于细粒度面部表情训练、嘴部和眼部追踪。
  2. without_face/ (2,287 对)

    • CLIP 分数 ≥ 0.25 且未检测到人脸,描述文本中不包含面部/眼部描述。
    • 适用于全身姿态、衣物和动作训练。
  3. mismatch/ (1,238 对)

    • CLIP 分数 ≥ 0.25 且未检测到人脸,但文本中提到了面部(由于极端相机角度、手部遮挡或头部扭转)。
    • 用于研究语义文本对齐与人脸检测之间的边界情况。
  4. low_quality/ (1,265 对)

    • CLIP 文本-图像对齐分数低于 0.25 阈值(挑战性或噪声相关的配对)。

每个文件夹包含的文件

  • .jpg 文件: 3D 渲染的角色图像。
  • .txt 文件: 对应的文本描述。
  • dataset_log.json: 3D 生成日志,包含该类别文件的精确物理属性和 FACS 控制参数。示例:
    • motion, frame, intensity, breath_value, camera (x/y/z_translate, y_rotation, focal_length), facs_ctrl_* (如 SmileFullFace, EyeLookSide-Side 等)。
  • report_partial.json: 该类别文件的验证报告,记录 CLIP 分数统计(threshold, total, valid_count, mean_score, std_score, low_score_count)和人脸检测统计(face_stats)。

数据使用说明

  • 自动加载(推荐): 使用 Hugging Face datasets 库,通过 load_dataset("nadizik/synthetic-human-expressions-poses-3d", data_files="3D_DATASET_sorted.zip") 自动下载和解压。
  • 手动下载: 在 Files and versions 标签页下载 3D_DATASET_sorted.zip 文件,使用标准工具解压即可获得四个子目录结构。

预期用途

  • 姿态引导生成(ControlNet / IP-Adapter): 基于精确物理相机设置和身体方向训练模型。
  • 面部表情训练(FACS 控制): 微调文本到图像模型,使其直接从描述性文本中识别动作单元(FACS)。
  • 多模态内容筛选(Curation): 探索在极端相机视角下人脸检测与语义文本对齐之间的差异边界。
搜集汇总
数据集介绍
synthetic-human-expressions-poses-3d 数据集图片
构建方式
该数据集通过单一基础3D人体模型生成,确保了数据的一致性。为获得丰富的多样性,数据集涵盖了广泛的肢体姿态、面部表情以及相机视角变化。具体而言,相机围绕主体旋转,从多个角度捕捉人物影像,最终形成了10,075组由独特身体姿态与精细面部表情组合而成的样本对。每份数据不仅包含渲染图像与对应的自然语言描述,还保留了详尽的3D元数据,包括精确的相机坐标、焦距以及基于FACS(面部动作编码系统)的面部混合形状强度参数。此外,所有样本均经过了CLIP ViT模型与OpenCV ResNet-10 SSD人脸检测器的验证与诊断,确保了数据质量。
特点
该数据集的一个显著特点在于其严格的质量分级体系。基于视觉对齐度、CLIP得分与人脸检测结果,所有样本被划分为四个子目录:含人脸的高对齐样本(5,285对)适用于精细的面部表情训练;无人脸的高对齐样本(2,287对)专注于全身姿态与动作识别;文本提及人脸但实际未检测到的错配样本(1,238对)揭示了极端视角下的语义与视觉差异;而低质量样本(1,265对)则反映了低于0.25阈值的噪声关联。每个子文件夹内均配有对应的3D生成日志与验证报告JSON文件,便于用户进行深入的统计分析与数据漂移监控。
使用方法
数据集以单一压缩归档文件形式发布,便于快速下载与存储。用户可通过Hugging Face的datasets库自动加载并解压,仅需一行Python代码即可完成数据集的结构化导入。对于手动下载的场景,用户可直接从文件标签页获取压缩包,使用标准解压工具提取后,即可获得按质量分级组织的四个子目录。每个子目录中均包含JPEG图像、对应的TXT文本描述、生成日志(dataset_log.json)以及验证报告(report_partial.json),为姿势引导生成、面部表情控制以及多模态数据策展等任务提供了即用型的结构化资源。
背景与挑战
背景概述
该数据集由研究团队于2026年创建,聚焦于3D合成人体姿态与面部表情的精细建模,核心研究问题涉及多视角下人体运动与面部动作编码系统(FACS)的联合表征。通过单一基础3D模型生成10,075对高保真渲染图像与自然语言注释,并附加精确相机参数、FACS强度及CLIP验证指标,为文本到图像生成、姿态估计、面部表情识别等领域提供了稀缺的合成数据资源,尤其推动了控制网络与FACS驱动表情合成的研究边界。
当前挑战
领域挑战在于传统数据集中人体姿态与面部表情的耦合表征不足,难以支撑极端视角、遮挡或低光条件下的鲁棒生成任务;现有真实数据标注成本高昂且隐私受限。构建过程中,需克服单一模型多样性局限,通过多视角旋转与动作组合实现10,075种独特配置,并设计基于CLIP分数与面部检测的严格筛选逻辑(如低质量子集阈值设为0.25),以处理因极端相机角度或遮挡导致的文本-图像语义失配问题,同时平衡高保真度与数据规模间的权衡。
常用场景
经典使用场景
该数据集最经典的用途在于为文本到图像生成模型提供精准的姿态与表情控制训练。通过包含10,075组高保真3D人体渲染图与详细自然语言注释的配对数据,研究者能够训练诸如ControlNet或IP-Adapter等模型,学习从描述性文本中精确还原人体姿态、面部表情及摄像机视角。数据集基于单一基础3D模型生成,通过多样化身体姿态、面部表情与摄像机角度实现丰富变化,并附有精确的3D元数据,包括摄像机坐标、焦距及基于FACS的面部混合变形强度,为细粒度的生成控制提供了坚实基础。
解决学术问题
该数据集有效解决了人体姿态与面部表情的精细语义对齐这一学术难题。传统文本-图像数据集往往缺乏对动作单元和三维空间参数的精确标注,限制了模型对复杂人体动态的捕捉能力。通过引入FACS(面部动作编码系统)的定量描述和精确的3D摄像机参数,该数据集为研究提供了标准化基准,支持在极端视角、手部遮挡等挑战性条件下评估模型表现。其基于CLIP分数和面部检测的严格筛选机制,进一步划分出高质量子集,推动了文本-图像一致性、跨模态对齐以及数据质量监控等方向的研究发展。
衍生相关工作
基于该数据集,学术界已衍生出多项重要工作。在姿态引导生成领域,研究者利用其精确的摄像机参数开发了视角可控的图像合成模型,实现了从单一文本描述生成多视角一致的人体图像。在面部表情控制方面,该数据集推动了基于FACS动作单元的文字到表情映射研究,使模型能同时理解复合表情的语义描述。此外,数据集中的'不匹配'和'低质量'子集催生了关于语义对齐边界探索的研究,例如分析面部检测失败时文本描述的有效性,以及如何在极端视角下保持身份与姿势的一致性,为多模态学习中的鲁棒性提升提供了实验基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务