遇见数据集

Chunjiang-Intelligence/OpenSCAD_3D_SFT

收藏
Hugging Face2026-06-18 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是一个用于OpenSCAD监督微调(SFT)模型的合成生成SFT对话语料库。它由参数级突变和创造性建模任务两部分组成,比例约为8:2。参数级突变部分涉及对种子示例在维度、位置和基数轴上进行受控扰动,用于直接代码生成任务;创造性建模部分则包含几何复杂问题,通过显式的逐步链式思维(CoT)推理解决,用于推理增强生成任务。数据集的目的是平衡模型对OpenSCAD语法规律的学习和组合推理能力的发展,支持从中文或英文自然语言规范生成有效、可编译且参数化的OpenSCAD源代码。

This dataset is a synthetic generative SFT dialogue corpus for OpenSCAD supervised fine-tuning (SFT) models. It consists of two parts: parameter-level mutation tasks and creative modeling tasks, with a ratio of approximately 8:2. The parameter-level mutation section involves applying controlled perturbations to seed examples along dimensions, positions, and cardinal axes, which is designed for direct code generation tasks; the creative modeling section includes geometrically complex problems solved via explicit step-by-step chain-of-thought (CoT) reasoning, targeting reasoning-augmented generation tasks. The goal of this dataset is to balance the model's learning of OpenSCAD grammatical rules and the development of its combinatorial reasoning capabilities, while supporting the generation of valid, compilable, and parameterized OpenSCAD source code from natural language specifications in either Chinese or English.

提供机构:
Chunjiang-Intelligence
搜集汇总
数据集介绍
Chunjiang-Intelligence/OpenSCAD_3D_SFT 数据集图片
构建方式
该数据集通过合成方式构建监督微调(SFT)对话,以8:2的比例划分为两个核心子集:其一为对标准种子设计进行参数级变异的突变样本,涵盖维度、位置与基数轴上的受控扰动;其二为高复杂度创意建模任务,需借助显式的思维链(Chain-of-Thought)推理逐步解析几何问题。所有样本均以中英文自然语言指令为输入,输出可编译的OpenSCAD源代码。
使用方法
使用时,对于突变样本,模型需直接根据文本规约生成OpenSCAD代码,无需中间推理。对于创意样本,则需遵循系统提示中的格式,先于<think>与</think>标记内进行推理,再输出完整代码块。在训练阶段,损失掩码应仅应用于助手的回复部分,包括推理段与代码段,而用户提示的损失则需忽略,以保留模型的链式推理能力。推荐基于DeepSeek-R1-Distill-Llama-8B或Qwen-2.5-Coder-7B进行微调,采用2×10⁻⁵学习率与余弦衰减,训练3个周期,全局批大小为64,最大序列长度设为4096令牌,并启用序列打包以优化吞吐量。
背景与挑战
背景概述
随着三维建模技术的快速发展,程序化建模语言如OpenSCAD因其精确的参数化与布尔运算能力,在工程设计与自动化生产领域扮演着日益重要的角色。然而,现有文本到代码生成模型多聚焦于通用编程语言,专门针对OpenSCAD等领域特定语言的监督微调数据集极为匮乏。为此,研究团队于近年构建了OpenSCAD_3D_SFT数据集,由致力于自然语言到三维源码生成的研究人员开发,旨在解决从中文或英文自然语言描述直接生成可编译、参数化OpenSCAD代码的核心问题。该数据集通过合成对话方式,以8:2比例划分变异(Mutation)与创意(Creative)两类任务,前者强化语法鲁棒性,后者通过思维链推理提升复杂几何建模能力。自发布以来,该数据集在推动三维代码生成领域的发展中展现出重要影响力,为基于大语言模型的程序化建模提供了可靠的训练基准。
当前挑战
该数据集所应对的领域挑战主要源自OpenSCAD代码生成的独特复杂性:其一,程序化建模需严格遵循构造实体几何(CSG)的布尔运算逻辑,而曲面间的重合易导致渲染伪影(如Z-fighting),这要求模型在生成代码时能自动融入微米级安全偏移量;其二,由于数据集完全基于文本,缺乏视觉反馈支撑,所有几何推理必须通过符号与数学运算在思维链令牌中完成,这对模型的抽象推理能力构成严峻考验。在构建过程中,团队面临数据合成与平衡的难题:变异任务虽能覆盖参数扰动,但难以穷尽几何拓扑的奇异情况;创意任务需设计既具几何精度又保留可解释性的思维链模板,同时确保推理步骤与最终代码间的逻辑一致。此外,模型训练时需对用户提示进行损失掩码,以维持思维链推理能力,对微调策略提出了精细约束。
常用场景
经典使用场景
在三维建模与程序化生成领域,OpenSCAD_3D_SFT数据集被广泛用于微调大语言模型,使其能够将自然语言描述精准转化为可编译、参数化的OpenSCAD代码。该数据集尤其擅长应对两类经典任务:其一为基于种子设计的参数级变异,通过控制尺寸、位置与基数等维度的扰动,训练模型直接生成代码;其二为高复杂度创意建模,要求模型在输出代码前,通过链式推理(Chain-of-Thought)进行显式逐步几何分析。这种设计使模型能够从结构化指令中习得稳健的语法规律,同时发展组合推理能力,成为连接人类自然语言表达与程序化三维建模的桥梁。
解决学术问题
该数据集系统性地解决了程序化三维建模中自然语言指令到代码生成的语义鸿沟问题,尤其针对复杂几何推理任务。传统方法往往无法处理需要多步骤分解的建模需求,如将Voronoi点阵结构映射到扭曲圆柱表面。通过引入链式推理范式,数据集促使模型在代码生成前进行显式的几何分析、参数定义与模块结构设计,有效缓解了因几何推理不足导致的代码编译失败或渲染异常。其意义在于推动了大语言模型在辅助几何设计领域的发展,为自动化CAD建模、智能辅助设计等学术研究提供了标准化的训练基准与评估框架。
实际应用
在实际应用中,基于OpenSCAD_3D_SFT数据集训练的模型可直接服务于工业设计、建筑造型与教育等领域的自动化建模需求。例如,设计师仅需用中文或英文描述“一个带有正弦波扭曲轮廓的镂空圆柱花瓶”,模型便能自主生成包含变量定义、循环结构与布尔运算的完整OpenSCAD代码。这一过程极大降低了程序化建模的门槛,使非编程背景的用户也能通过自然语言驱动复杂三维几何的生成。在数字孪生、快速原型制造与个性化定制场景中,模型可显著提升从概念描述到可执行代码的转化效率。
数据集最近研究
最新研究方向
当前,OpenSCAD_3D_SFT数据集正引领着文本到三维模型生成领域的前沿探索,其核心创新在于将链式思维推理与监督微调范式深度融合于程序化三维建模之中。随着大型语言模型在代码生成任务中的卓越表现,该数据集通过精心设计的突变与创造性双重任务架构,不仅强化了模型对参数化几何语法的鲁棒习得,更催化了复杂三维几何问题的逐步分解与符号推理能力。这一方向紧密关联着三维内容自动化生成的热点事件,例如AIGC在数字孪生与虚拟现实中的规模化落地,其意义在于突破了传统三维建模依赖视觉反馈的瓶颈,为无视觉引导的纯符号几何推理开辟了新路径,推动了生成式模型在工程设计与创意领域的智能化跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务