遇见数据集

yawpose

收藏
github2026-09-05 更新2026-09-06 收录
数据链接:
官方服务:

资源简介:

yawpose是一个纯合成数据集,模拟了真实世界中的噪声(低分辨率、模糊、遮挡、压缩),覆盖广泛的相机角度、头部俯仰和完整的360°偏航圆。合成过程还批量生成带有遮挡物和外观变化的样本——眼镜、太阳镜、口罩、兜帽、有/无头发、有/无胡须、耳环、项链等——涵盖不同性别和年龄组。该数据集采用CC BY 4.0许可。

YawPose is a purely synthetic dataset that simulates real-world noises including low resolution, blurriness, occlusion, and compression. It covers a wide range of camera angles, head pitches and a full 360° yaw circle. During the synthesis pipeline, samples with various occlusions and appearance variations are batch-generated, such as glasses, sunglasses, face masks, hoods, with/without hair, with/without beard, earrings, necklaces and more, spanning different genders and age groups. This dataset is licensed under CC BY 4.0.

创建时间:
2026-09-05
原始信息汇总

YawNet 数据集总结

核心任务

YawNet 是一个专注于360°全景头部偏航角(yaw)估计的项目,采用 biternion (cos/sin) 回归方法,利用 DINOv3 教师-学生蒸馏技术,在纯合成数据集上完成从数据构建、训练到 ONNX 导出的完整流程。

数据集特点

  • 纯合成数据:训练和验证完全基于合成数据(yawpose 数据集),避免现有公共数据集(300W-LP、AFLW2000、BIWI 等)非商业用途限制及真实世界样本缺失(尤其后脑勺视角)的问题。
  • 模拟真实噪声:合成数据已包含低分辨率、模糊、遮挡、压缩等真实场景退化,并覆盖多种相机角度、头部俯仰角、完整360°偏航角。
  • 外观多样性:生成样本包含眼镜、口罩、头巾、有无头发/胡须、耳环、项链等配件变化,跨越不同性别和年龄段。
  • 规模:清洗后共 42,135 张 320×320 头部裁剪图像,训练:验证 = 9:1(4,211 张验证图像)。

数据标注规范

  • 标注覆盖完整 360° 偏航角,偏航分布均匀,无空白方向(通过 s004–s006 批次补足后方半球及困难角度范围)。
  • 俯仰角范围约 ±120°,包含极端上下视角;滚动角集中于 0° 附近。
  • 提供详细的可视化分析图(偏航分布直方图/极坐标图、偏航-俯仰-滚动分布图等)。
  • 数据集及配套工具依据 CC BY 4.0 许可发布。

模型性能(在 yawpose 验证集上,参考值)

模型 输入大小 参数 (M) MAAE (度) 中位误差 (度) acc15 (%) acc30 (%)
YawNet-64 64×64 0.77 12.94 8.65 73.5 92.6
YawNet-96 96×96 0.77 12.96 8.62 74.2 92.6
YawNet-128 128×128 0.77 12.62 8.47 75.7 92.6
DINOv3 ViT-L + biternion(教师模型) 320×320 304.20 0.97 0.78 99.98 100.0
  • 作为外部参考,SemiUHPE(全范围,公开权重)在同一验证集上 MAAE 为 55.14°,acc30 为 53.5%。
  • 上述数值为参考结果(训练时混合训练+验证数据),非验证集留出结果;仅用训练集训练的同款 DINOv3 教师模型留出验证 MAAE 为 13.55°。

训练与蒸馏方案

  • 支持多档 VRAM(8/16/96GB)配置,有效批大小一致,可跨档位断点续训。
  • 教师模型可选择 YawNet-320(约 3.0M 参数)或 DINOv3 ViT-L/16(304M,预训练权重按 DINOv3 许可单独获取)。
  • 从 320×320 教师模型向低分辨率学生模型(64/96/128)进行蒸馏,学生端损失 = α·NLL(student, teacher) + β·NLL(student, GT)。
  • 支持 κ(置信度)头和 von Mises NLL 损失,自动对困难样本降权;支持 EMA 及 wsd 学习率调度。

数据获取与复现

  • 仓库本身不含数据,需要从 GitHub Resources Release(https://github.com/PINTO0309/YawNet/releases/tag/resources )下载:
    • yawpose.tar.gz → 统一 yawpose 数据集(放入 data/yawpose/
    • 原始合成数据 synthetic_001..006
    • 辅助 ONNX 模型(如头部检测器、标签验证、关键点模型)
    • 训练好的模型运行文件及导出 ONNX
  • 构建命令:uv sync --frozen && uv run python scripts/build_yawpose_dataset.py

关键文档与许可

  • 数据集规格及完整标注修正历史见 docs/yawpose_dataset.md
  • 数据生成规范文档:docs/synthetic_004/005/006_generation_spec.md
  • 本项目刻意不使用任何已建立的头部姿态基准数据集(用于训练或评估)
  • 代码与数据集许可:MIT(代码),CC BY 4.0(数据集),DINOv3 权重按相应许可使用。
搜集汇总
数据集介绍
yawpose 数据集图片
构建方式
yawpose数据集是一项突破传统头部姿态估计数据壁垒的纯合成数据集构建工程。其构建核心在于,为弥补现有公开数据集在后视图及极端姿态上的缺失,并规避非商业授权限制,采用大规模合成技术生成42,135张涵盖360°全范围偏航角的高质量头部裁剪图像。构建流程精细缜密,首先利用DEIMv2检测器进行头部定位并以5%边界余量进行方形裁剪,统一缩放至320x320分辨率。随后,借助sixdrepnet360与HRFFA地标模型对标签进行严格的符号校正与可验证性筛选,并引入辅助式教师模型对后视图样本进行重标注审计。为达成方向分布的均衡,依据预生成的分布缺口分析,定制化补充了s004至s006三个批次的特定姿态样本,同时内嵌模拟现实干扰的合成噪声,最终形成训练与验证集按9:1比例划分的规范数据集。
特点
yawpose数据集的核心特质在于其彻底合成化与全向覆盖的独到设计。其标签体系采用二分量比特尼恩表示法联合冯·米塞斯浓度系数,可无缝表达360°周期角度并附带置信度信息,彻底规避了角度环绕歧义。数据分布经统计分析验证,在10°分箱的直方图与极坐标图中呈现严丝合缝的全圆覆盖,尤其强化了前视主峰之外的120°至270°后侧半球样本,消弭了传统数据集的角度缺失盲区。不仅如此,数据集内嵌低分辨率、运动模糊、遮挡、压缩伪影等真实世界退化因素,并系统性地变化配饰、发型、面部毛发等外观属性,覆盖不同性别与年龄段,赋予模型在复杂现实场景中的强泛化能力。纯合成属性亦解除了授权束缚,为工业界应用提供了合法合规的高质量训练资源。
使用方法
使用yawpose数据集开展研究与实践的路径清晰直观。研究者可从资源发布页获取已生成的yawpose.tar.gz归档文件,解压后置于规范目录结构中即可直接用于模型训练与验证。仓库提供了完整的端到端脚本套件,覆盖数据构建、标签质控、分布可视化、模型训练、知识蒸馏乃至ONNX导出全链路。训练环节支持多级显存自适应战略,通过统一的批大小预设确保跨硬件训练动态的一致性,并允许断点续训。该数据集既可直接用于从头训练轻量化YawNet模型,亦可作为蒸馏学习中的教师数据源,配合DINOv3大模型教师生成学生模型。此外,附带的评估脚本支持与半监督方法SemiUHPE的对比验证,使研究者能客观定位模型性能边界。
背景与挑战
背景概述
yawpose数据集由Katsuya Hyodo于2026年创建,源自YawNet项目,旨在解决头部姿态估计中全圆周偏航角回归的难题。现有公开数据集(如300W-LP、AFLW2000等)多受限于非商业用途协议,且缺乏真实世界中常见的后视角度,难以满足实际产品需求。yawpose通过纯合成方式生成42,135张包含360°全圆周偏航、极端俯仰角及丰富遮挡与外观变化的头部图像,并内嵌低分辨率、模糊、压缩等真实噪声,规避了数据许可问题。该数据集在领域内独树一帜,为全圆周头部偏航估计提供了高精度训练与评估基准,其蒸馏学生模型(如YawNet-128)在验证集上达到12.62°的平均角度误差,展示了显著影响力。
当前挑战
yawpose数据集面临的挑战多维且深刻。在领域问题层面,其核心任务是克服传统头部姿态数据集中于正面视角的偏倚,实现360°全圆周偏航,尤其针对后视与极端角度,这要求模型具备高度鲁棒的方向感知能力,挑战了现有方法对角度连续性与对称性的处理。在构建过程中,挑战源于纯合成数据的生成与质量控制:需精心设计合成参数以模拟真实世界噪声(如遮挡、模糊、分辨率变化),同时确保偏航标签的精确性与一致性,涉及复杂的数据清洗、标签修复及教师模型重标注流程。此外,平衡各角度区间的样本分布以覆盖均匀的偏航空间,亦是一大难点,需迭代生成补充批次并借助分布分析工具进行精细调控。
常用场景
经典使用场景
yawpose数据集凭借其全圆周头部偏航角标注与纯合成数据特性,成为360°头部姿态估计领域的重要基准资源。其经典使用场景聚焦于训练与评估鲁棒的偏航角回归模型,尤其针对现实世界中频繁出现但现有数据集匮乏的背面视角。该数据集涵盖完整360°偏航范围、极端俯仰角以及丰富的外观变化,如眼镜、口罩、帽子等遮挡物,模拟真实场景中的低分辨率、模糊与压缩噪声。研究者常将其用于开发轻量级、高精度的偏航角专用模型,或作为教师-学生蒸馏框架中知识迁移的目标域,以提升模型在复杂视角下的泛化能力。
实际应用
yawpose数据集的实际应用场景广泛延伸至人机交互、智能监控、驾驶员监测及虚拟现实等领域。在辅助驾驶系统中,利用其训练的模型可实时监测驾驶员头部朝向,判断分神或疲劳状态,提升行车安全。在零售分析中,通过头部偏航角估计可推断顾客注意力与兴趣区域,优化商品陈列。此外,该数据集支持生成低功耗边缘设备可部署的轻量模型,适用于嵌入式视觉系统,如机器人导航与增强现实设备,实现对用户头部动作的即时响应。其纯合成数据特性亦为隐私敏感场景提供安全训练方案,避免使用真实人脸数据引发的合规风险。
衍生相关工作
yawpose数据集催生了一系列相关衍生工作,在方法论与评估框架层面产生了深远影响。其数据构建流程启发了后续合成数据生成策略的研究,特别是针对姿态标签的自动化验证与修复机制,如通过辅助模型进行标签审计与重标注,提高了大规模合成数据集的标注可靠性。教师-学生蒸馏范式在该数据集上的成功应用,促进了轻量化姿态估计模型的发展,使得高精度模型能够以极低参数量在实时系统中运行。此外,基于该数据集的全圆周偏航评估标准,推动了业界对头部姿态基准的重新思考,孕育了面向非受限视角的专用评估协议,并可能激发利用合成数据弥合域差异、提升跨数据集泛化能力的新技术路线。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务