遇见数据集

yejunliang23/3DRewardDB

收藏
Hugging Face2024-07-10 更新2024-07-22 收录
官方服务:

资源简介:

3DRewardDB是一个多样化的3D数据集,适用于训练和测试与人类偏好对齐的模型。为了构建3DRewardDB,我们从cap3d中选择了2530个提示,每个提示对应4到10个使用ashawkey/mvdream-sd2.1-diffusers生成的3D资产。注意:由于数据集将用于商业用途,因此只开源了1000个提示。

3DRewardDB is a diverse 3D dataset suitable for training and testing models aligned with human preferences. To build the 3DRewardDB, we select 2530 prompts from cap3d, each corresponding to 4-10 3D assets generated using ashawkey/mvdream-sd2.1-diffusers. Notice: The complete dataset will be used for commercial purposes, so we have only open-sourced 1000 of the 2530 prompts.

提供机构:
yejunliang23
原始信息汇总

3DRewardDB 数据集

数据集描述

数据集概述

  • 名称: 3DRewardDB
  • 语言: 英语
  • 任务类别: 文本到3D
  • 许可证: Apache 2.0

3DRewardDB 是一个多样化的3D数据集,适用于训练和测试与人类偏好对齐的模型。该数据集从 cap3d 中选择了2530个提示,每个提示对应4-10个使用 ashawkey/mvdream-sd2.1-diffusers 生成的3D资产。

注意: 完整的2530个提示将用于商业用途,因此我们仅开源了其中的1000个提示。

数据集结构

./ ├── data │   ├── 0 │   │   ├── 0.png │   │   ├── cam_0.pkl │   │   ├── 1.png │   │   ├── cam_1.pkl │   │ └── [...] │   ├── 1 │   ├── 2 │   ├── [...] │   └── 999 └────── prompt_reward.json

搜集汇总
数据集介绍
yejunliang23/3DRewardDB 数据集图片
构建方式
3DRewardDB数据集旨在服务于文本到三维内容生成领域,以满足模型训练与测试中对人类偏好对齐的需求。该数据集从Cap3D数据集中精心遴选出2530条提示词,每条提示词均对应4至10个经由ashawkey/mvdream-sd2.1-diffusers框架生成的三维资产。值得注意的是,由于完整数据集将用于商业用途,目前仅开源了其中1000条提示词所对应的数据。
特点
该数据集以多样化与偏好对齐为核心特点,涵盖广泛的三维生成场景,为研究人类审美偏好与三维模型质量之间的关系提供了坚实的数据基础。每条提示词对应多个由不同视角渲染的二维图像及其相机参数,结构清晰,便于多视角分析与评估。此外,数据集附有prompt_reward.json文件,记录了提示词与对应奖励信息,强化了其在偏好学习任务中的实用性。
使用方法
使用3DRewardDB时,研究人员可直接加载data目录下按编号组织的子文件夹,每个文件夹包含多视角渲染图像及相机参数文件,适用于三维重建或偏好模型训练。通过解析prompt_reward.json,可获取提示词与奖励标签的映射关系,便于构建监督学习或强化学习任务。数据集支持以PyTorch或TensorFlow框架进行批处理,推荐结合HuggingFace Datasets库进行高效加载与预处理。
背景与挑战
背景概述
在文本到三维生成领域,如何使生成的三维资产更符合人类审美偏好始终是核心难题之一。2024年,由叶俊良等人所在团队提出的DreamReward系统及其配套数据集3DRewardDB,旨在构建一个基于人类反馈的奖励模型,以优化三维内容生成的质量。该数据集选取了来自Cap3D的2530个文本提示,每个提示对应4至10个由MVDream模型生成的三维资产,并通过人工标注赋予偏好分数。3DRewardDB的诞生填补了三维领域缺乏大规模、高质量人类偏好标注数据的空白,为后续研究提供了可靠的训练与评估基准,推动了文本到三维生成技术向更符合人类直觉的方向演进。
当前挑战
3DRewardDB所面临的挑战首先体现在领域问题的复杂性上:三维生成模型在多样性、细节保真度和语义一致性上难以同时满足人类偏好,现有评价指标如CLIP相似度无法全面反映真实审美需求。在构建过程中,团队遭遇了数据标注成本高昂的瓶颈,每个三维资产需多角度渲染并由多名标注者评审,以确保偏好分数的可靠性。此外,由于数据集将用于商业用途,仅开源了2530个提示中的1000个,如何在保护商业利益的同时维持数据集的多样性和代表性,成为制约其广泛应用的现实难题。
常用场景
经典使用场景
3DRewardDB数据集专为文本到三维(Text-to-3D)生成任务中的偏好对齐而设计。其最经典的使用场景在于训练和评估能够反映人类审美与语义偏好的奖励模型。研究者可借助该数据集中的多样化三维资产及其对应的文本提示,构建一个从文本描述到三维形态的偏好映射函数。通过对比生成结果与人类标注的偏好分数,模型得以学习如何生成更符合用户期望的三维内容,从而推动三维生成技术从“生成可用”迈向“生成满意”的更高层次。
解决学术问题
该数据集直击三维生成领域长期存在的核心学术难题:如何量化并融入人类对三维物体的主观偏好。传统方法多依赖几何或光度损失函数,难以捕捉视觉美感、结构合理性等主观维度。3DRewardDB通过大规模人工标注的偏好数据,为学术界提供了首个系统性的三维偏好基准。它使得研究者能够训练出可靠的奖励模型,进而通过强化学习或引导式采样策略优化三维生成器,显著提升了生成结果在用户研究中的接受度与满意度。
衍生相关工作
3DRewardDB催生了一系列具有影响力的后续研究。其配套论文《DreamReward: Human Preference Alignment for Text-to-3D Generation》首次系统性地将人类偏好引入三维生成流程。后续工作包括基于该数据集的偏好感知扩散模型改进、多视角一致性奖励函数设计,以及将奖励模型与大型语言模型结合的三维语义理解框架。这些衍生研究共同推动了三维生成领域从无监督学习向弱监督与人类反馈强化学习范式的转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务