PoseDreamer
收藏资源简介:
PoseDreamer是由牛津大学团队构建的大规模合成人体数据集,通过扩散模型实现高真实感图像生成与精准3D姿态控制。该数据集包含50万张标注SMPL-X参数的图像,数据源自LAION和AMASS的混合采样,结合硬样本挖掘与多阶段过滤确保多样性。其创新性在于将3D网格参数逆向编码为RGB空间,利用Direct Preference Optimization强化生成控制,解决了传统渲染方法成本高、真实性不足的问题。该数据集专为人体网格恢复任务设计,可提升模型在复杂场景下的姿态估计鲁棒性,填补了真实标注数据与合成数据间的领域鸿沟。
PoseDreamer is a large-scale synthetic human dataset developed by a team from the University of Oxford, which enables high-fidelity image generation and precise 3D pose control via diffusion models. It contains 500,000 images annotated with SMPL-X parameters, sourced from hybrid sampling of LAION and AMASS. Hard sample mining and multi-stage filtering are employed to ensure data diversity. Its innovation lies in inversely encoding 3D mesh parameters into the RGB space, and leveraging Direct Preference Optimization (DPO) to enhance generation control, which addresses the issues of high cost and insufficient realism associated with traditional rendering methods. This dataset is specifically designed for the human mesh recovery task, which can improve the robustness of pose estimation models in complex scenarios, and bridges the domain gap between real annotated data and synthetic data.
PoseDreamer数据集概述
数据集基本信息
- 数据集名称: PoseDreamer
- 发布年份: 2026
- 论文状态: arXiv预印本
- 相关链接:
- 论文: https://prosperolo.github.io/posedreamer
- 代码: 即将发布
- 数据集: https://prosperolo.github.io/posedreamer
核心目标
PoseDreamer是一个可扩展的流程,旨在通过扩散模型生成具有精确3D姿态控制的光照真实感人体数据集,以解决3D人体网格估计任务中标注数据获取困难的问题。
方法概述
- 核心技术: 结合可控图像生成与直接偏好优化(Direct Preference Optimization)进行控制对齐。
- 关键步骤:
- 基于课程学习的困难样本挖掘。
- 多阶段质量过滤。
- 核心优势: 自然保持3D标注与生成图像之间的对应关系,同时优先处理具有挑战性的样本以最大化数据集效用。
数据集规模与质量
- 样本数量: 超过500,000个高质量合成样本。
- 标注信息: 提供精确的3D网格标注。
- 图像质量指标:
- 相较于基于渲染的数据集,图像质量指标提升76%。
- FID得分为1.72。
- IS得分为9.78。
- 控制对齐增益: 直接偏好优化带来**42%**的OKS误差减少。
性能评估
作为唯一训练数据
在野外基准测试(PVE指标,越低越好)中,PoseDreamer作为唯一训练数据,性能全面超越BEDLAM数据集:
- UBody数据集: 97.6 (PoseDreamer) vs 146.3 (BEDLAM)
- MPII数据集: 122.3 (PoseDreamer) vs 141.1 (BEDLAM)
- MSCOCO数据集: 129.4 (PoseDreamer) vs 163.7 (BEDLAM)
与现有合成数据的互补性
- 仅结合PoseDreamer和BEDLAM两个数据集进行训练,其性能即可匹配或超越依赖五个及以上真实与合成数据集的基线方法。
- 该结论在多种模型规模(ViT-S和ViT-L骨干网络)和数据集大小(高达150万个实例)下均成立。
领域特定生成
在MPII Yoga基准测试中,用3万个瑜伽特定样本替换随机图像,可将PVE从199.6降低至171.1。
引用格式
bibtex @article{prospero2026posedreamer, title = {PoseDreamer: Scalable Photorealistic Human Data Generation with Diffusion Models}, author = {Prospero, Lorenza and Kupyn, Orest and Viniavskyi, Ostap and Henriques, Joao F. and Rupprecht, Christian}, journal = {arXiv preprint}, year = {2026} }

- 1PoseDreamer: Scalable and Photorealistic Human Data Generation Pipeline with Diffusion Models牛津大学·视觉几何组; 牛津大学·体育医学与技术研究所; 乌克兰天主教大学 · 2026年



