遇见数据集

P3D-Dataset

收藏
arXiv2026-06-11 更新2026-06-12 收录
官方服务:

资源简介:

P3D-Dataset是由南京大学与Envision联合构建的用于参数化三维生成与结构推理的基准数据集。该数据集包含1003个案例,涵盖400个文本到3D、400个图像到3D以及203个标注装配体任务,数据来源于Text2CAD v1.1和Fusion 360 Gallery,经过筛选、去重和平衡处理,确保几何可执行性与视觉清晰度。数据集通过多阶段流程构建,包括过滤不可靠案例、使用MLLM进行语义标注与验证,并生成描述性、参数化及部件级文本规范。其核心应用在于评估多模态大语言模型在生成精确参数化几何与部件级结构方面的能力,旨在推动三维建模中代码生成与空间推理的研究进展。

The P3D-Dataset is a benchmark dataset jointly developed by Nanjing University and Envision for parametric 3D generation and structural reasoning. It contains 1003 instances, covering 400 text-to-3D, 400 image-to-3D, and 203 annotated assembly tasks. Sourced from Text2CAD v1.1 and Fusion 360 Gallery, the dataset has undergone filtering, deduplication, and balancing procedures to guarantee geometric executability and visual clarity. Constructed through a multi-stage workflow, it includes filtering unreliable instances, conducting semantic annotation and validation with MLLMs, and generating descriptive, parametric, and part-level textual specifications. Its core application is to evaluate the capabilities of multimodal large language models (LLMs) to generate precise parametric geometry and part-level structures, aiming to advance research on code generation and spatial reasoning for 3D modeling.

提供机构:
南京大学; Envision
创建时间:
2026-06-10
原始信息汇总

P3D-Bench 数据集详情

数据集简介

P3D-Bench 是一个用于评估多模态大语言模型(MLLMs)在参数化 3D 生成与结构推理能力上的基准测试。与传统的 3D 网格不同,参数化 3D 程序能够暴露明确的尺寸、构造操作和零件关系,从而揭示模型是否真正恢复设计结构,而不仅仅是外观。

任务类型

P3D-Bench 在统一协议下涵盖三大任务:

  • Text-to-3D(文本到3D):基于文本描述生成参数化3D程序
  • Image-to-3D(图像到3D):基于图像输入生成参数化3D程序
  • Assembly-3D(装配到3D):涉及多部件组合成连贯结构的装配任务

代码格式

支持四种输出格式:JSON、OpenSCAD、CadQuery、Three.js

评估指标

对每个输出从以下维度进行评分:

  • Executability(可执行性)
  • Geometric fidelity(几何保真度)
  • Topology(拓扑结构)
  • Text-grounded constraints(文本约束对齐)
  • Multiview semantic alignment(多视图语义对齐)
  • Part-level structure(零件级结构)

数据集规模

  • 400 个文本测试用例
  • 400 个图像测试用例
  • 203 个带标注的装配体

排行榜摘要

Text-to-3D 任务(Top模型,平均分)

模型 Judge(描述性) Valid(描述性) Judge(参数化) Valid(参数化)
GPT-5.5 0.875 0.998 0.812 0.999
Gemini 3.1 Pro 0.865 0.999 0.776 1.000
Claude Opus 4.6 0.850 0.995 0.788 0.995
Kimi K2.6 0.804 0.949 0.716 0.988
GLM-5.1 0.810 0.941 0.687 0.966

Image-to-3D 任务(平均分)

模型 Geo(几何) Topo(拓扑) Judge Valid(有效)
GPT-5.5 0.549 0.914 0.562 0.979
Gemini 3.1 Pro 0.552 0.910 0.540 0.970
Claude Opus 4.6 0.525 0.903 0.431 0.975
Kimi K2.6 0.497 0.898 0.382 0.960

Assembly-3D 任务(平均分)

模型 Geo(几何) Topo(拓扑) Judge Part(零件) Valid(有效)
GPT-5.5 0.586 0.966 0.541 0.629 0.985
Gemini 3.1 Pro 0.566 0.944 0.507 0.618 0.960
Claude Opus 4.6 0.525 0.926 0.376 0.573 0.944

主要发现

  1. 装配任务最具挑战性:模型仍无法将多个部件组合成连贯结构
  2. 全局形状与语义识别较好:模型能恢复目标物体的整体形状和语义,但难以复现输入指定的精确参数化几何
  3. 零件级建模薄弱:在装配任务中,模型既无法恢复每个零件的几何形状,也无法恢复正确数量的零件

数据集来源

  • 基于 Text2CAD 和 Fusion 360 Gallery 进行过滤与标注

引用

@misc{yang2026p3dbenchbenchmarkingmllmsparametric, title={P3D-Bench: Benchmarking MLLMs for Parametric 3D Generation and Structural Reasoning}, author={Yikang Yang and Zhanpeng Hu and Youtian Lin and Mengqi Zhou and Jingxi Xu and Feihu Zhang and Jiaheng Liu and Yao Yao}, year={2026}, eprint={2606.11152}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2606.11152}, }

搜集汇总
数据集介绍
P3D-Dataset 数据集图片
构建方式
P3D-Dataset的构建依托于两个开放的CAD数据源:Text2CAD v1.1与Fusion 360 Gallery。为克服原始数据中不可评估记录、视觉模糊及冗余等问题,研究团队设计了一套两阶段流水线。在过滤阶段,通过确定性检查剔除无法执行的案例,并借助Gemini 3.1 Pro作为评审MLLM筛选出视觉清晰、可重构的模型;随后基于DINOv2特征匹配去除近重复项,最终按复杂度和语义类别进行均衡采样,得到400个Text-to-3D与400个Image-to-3D案例。在标注阶段,针对Text-to-3D数据,利用GPT-5.5为每个零件生成描述性规格与参数化规格;针对Image-to-3D数据,由Claude Opus 4.6标注零件级与装配级描述,并经验证MLLM检查一致性,最终筛选出203个标注完备的Assembly-3D案例。
特点
P3D-Dataset的核心特点在于其面向可执行参数化三维建模的全面性与结构化标注。它涵盖三项递进任务:Text-to-3D评估从文本描述生成单个零件的能力;Image-to-3D要求模型从单张渲染图像推理出多零件物体的几何与布局;Assembly-3D则进一步挑战模型整合多个零件为连贯结构,并满足零件级与装配级的文本约束。数据集的独特价值在于其标注不仅包含自然语言描述,还包括精确的尺寸和放置参数,使得模型的表现可从语义对齐与几何精度两个维度进行分离评估。此外,数据集覆盖多种输出格式(JSON、OpenSCAD、CadQuery、Three.js),且其标注均经MLLM验证与几何校验,确保了评估的可靠性。
使用方法
使用P3D-Dataset时,研究者需依据任务类型(Text-to-3D、Image-to-3D或Assembly-3D)选择对应的输入规格,并指定目标输出格式。模型需将输入(描述性文本、参数化文本、单张渲染图或含零件标注的装配描述)转化为对应格式的可执行程序代码。P3D-BENCH随后执行该程序,渲染输出为三维网格,并与真值进行对齐,从几何保真度、拓扑质量、MLLM评判及零件级结构四个维度进行打分。所有评估指标均归一化至[0,1]区间,便于跨模型、跨格式比较。研究者亦可利用内置的QA测试集与视觉评判器,深入分析模型在语义理解与参数精确度上的具体表现。
背景与挑战
背景概述
参数化三维生成作为连接自然语言、图像与结构化几何建模的关键技术,近年来随着多模态大语言模型(MLLMs)的崛起而获得全新发展动力。南京大学与Envision团队于2026年联合构建了P3D-BENCH基准测试,并首次发布P3D-Dataset数据集,旨在填补现有基准在参数化三维生成与结构推理评估方面的空白。该研究由Yikang Yang、Zhanpeng Hu等学者主导,聚焦于评估MLLMs能否从文本或图像描述中生成可执行的参数化三维程序,而不仅仅是产生视觉上合理的网格模型。P3D-Dataset从Text2CAD v1.1和Fusion 360 Gallery两大CAD来源中精心筛选与注解,最终形成涵盖400个文本案例、400个图像案例和203个装配案例的标准化评估集合,有力推动了三维生成从外观模拟向精确几何与部件级结构推理的范式转变。
当前挑战
该数据集所面临的挑战主要体现在两大方面。首先,在领域问题层面,参数化三维生成不仅要求模型生成可运行的代码,更需保证几何精度、语义对齐与装配一致性,这与传统的网格生成或文本到三维任务有本质区别。现有模型在恢复全局形状与语义身份方面表现尚可,但在精确参数化几何再现和部件级建模上存在显著短板,如强模型在几何对齐得分(J-Geo)仅约0.35,远低于语义对齐得分(J-Sem)的0.8。其次,在数据构建过程中,原始CAD数据源包含大量不可执行、视觉模糊或近乎重复的样本,且缺乏描述性与参数化规格说明及装配级、部件级文本标注。研究团队为此设计了包含过滤和注解两阶段的复杂流水线,通过多模态大模型的自动审核与验证,最终保证数据集的高质量与平衡性,但这一过程本身亦对数据清洗与一致性维护提出了严峻挑战。
常用场景
经典使用场景
在三维计算机视觉与生成领域,P3D-Dataset被广泛用于评估多模态大语言模型在参数化三维生成与结构推理任务上的综合能力。该数据集覆盖了从文本描述、单张图像到多部件装配的三种典型输入设定,要求模型输出可执行的程序化三维模型。其经典使用场景在于,研究者通过该数据集测试模型是否能够在语义理解之外,精准还原指定部件的几何尺寸、拓扑结构以及部件间的空间装配关系,从而判断模型对于结构化三维设计的真实掌握程度。
实际应用
在实际工业与应用层面,P3D-Dataset所推动的评估范式直接服务于计算机辅助设计、数字孪生与智能制造等领域。通过验证模型能否从自然语言或视觉输入生成可编辑、可复用的参数化程序,该数据集为自动化三维建模工具的质量保障奠定了评测基础。例如,在机械零件设计、家具组装与机器人抓取规划等场景中,依赖该数据集训练的模型有望显著提升从设计意图到可执行三维模型之间的转化精度与效率。
衍生相关工作
P3D-Dataset的发布催生了一系列衍生的经典研究工作,包括基于多轮智能体交互的三维程序修复框架、面向装配体关节结构的可动参数化生成系统,以及利用几何与视觉反馈迭代优化三维代码的智能体方法。这些工作沿袭了该数据集所确立的多格式、多任务评估协议,进一步拓展了模型在复杂装配推理、细粒度部件匹配与可制造性验证方面的能力边界,推动了参数化三维生成从外观模拟迈向结构精准还原的关键跨越。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务