遇见数据集

cadqa-rl-2000

收藏
Hugging Face2026-08-09 更新2026-08-10 收录
官方服务:

资源简介:

该数据集名为 CAD-QA RL Training Set (2000 samples),专为 CAD 几何推理领域的强化学习(RL)训练设计。数据集源自 CAD-QA 基准测试中的 release_10k 训练集拆分,并采用 cad_browsecomp 难度级别。每个样本是一个闭卷问题:包含一段 CadQuery 脚本以及一个关于该脚本生成几何形状的问题,答案通过精确匹配进行验证,适用于可验证奖励的 RL 训练。数据集共包含 2000 个训练样本和 98 个验证样本(验证样本来源于基准测试的评估切片,不参与训练)。每个样本包含以下字段:row_id(唯一标识符)、prompt(闭卷提示,包括 CadQuery 脚本和问题)、answer_format(答案格式,如 text、candidate_label、coordinate)、gold_answer(精确匹配的目标答案,JSON 编码,需使用 json.loads 解码)、difficulty_bucket(难度级别,固定为 cad_browsecomp)、logical_hop_count(推理跳数)、geometry_hop_count(几何跳数)、relation_families(关系系列列表)。奖励机制为:如果解析后的答案(根据 answer_format 解析)与 gold_answer 精确匹配,则得分为 1.0,否则为 0.0。数据由 CAD-QA 管线通过 AST/数据流图及 CadQuery 执行从公开的 CADEvolve 源语料库合成生成,不包含人工或个人数据。

This dataset is named CAD-QA RL Training Set (2000 samples), specifically designed for reinforcement learning (RL) training in the domain of CAD geometric reasoning. The dataset is derived from the release_10k training split of the CAD-QA benchmark, using the cad_browsecomp difficulty level. Each sample is a closed-book problem: it includes a CadQuery script and a question about the geometry generated by that script. Answers are verified by exact match, suitable for RL training with verifiable rewards. The dataset contains a total of 2000 training samples and 98 validation samples (validation samples come from the evaluation slice of the benchmark and are not used for training). Each sample includes the following fields: row_id (unique identifier), prompt (closed-book prompt including the CadQuery script and question), answer_format (answer format, e.g., text, candidate_label, coordinate), gold_answer (target answer for exact match, JSON-encoded, needs to be decoded using json.loads), difficulty_bucket (difficulty level, fixed as cad_browsecomp), logical_hop_count (number of logical hops), geometry_hop_count (number of geometry hops), relation_families (list of relation families). The reward mechanism is: if the parsed answer (parsed according to answer_format) exactly matches the gold_answer, the score is 1.0; otherwise, it is 0.0. The data is synthetically generated by the CAD-QA pipeline via AST/dataflow graphs and CadQuery execution from the public CADEvolve source corpus, containing no human or personal data.

创建时间:
2026-08-08
原始信息汇总

CAD-QA RL 训练集(2000 样本)数据集概述

基本信息

  • 语言:英语(en)
  • 许可证:Apache 2.0
  • 任务类型:问答(question-answering)、文本生成(text-generation)
  • 标签:CAD、几何推理、强化学习(RL)、GRPO

数据集内容

该数据集来源于 CAD-QA 基准测试(release_10k 训练分割,cad_browsecomp 难度级别),包含 2000 条用于 CAD 几何推理的可验证奖励强化学习训练数据。每条数据为闭卷问题:包含一段 CadQuery 脚本及关于生成几何形状的问题,标准答案可通过精确匹配进行验证。

数据划分

  • 训练集:2000 条
  • 验证集:98 条(基准测试的评估切片;明确排除在训练之外,禁止使用该文件进行训练)

数据字段说明

字段 类型 说明
row_id 字符串 唯一行标识
prompt 字符串 闭卷提示(CadQuery 脚本 + 问题)
answer_format 字符串 textcandidate_labelcoordinate
gold_answer 字符串 精确匹配目标,JSON 编码(如 "wp15""A""[1.0, 2.0, 3.0]"),需用 json.loads 解码后比较
difficulty_bucket 字符串 cad_browsecomp
logical_hop_count 整数 逻辑推理步数
geometry_hop_count 整数 几何推理步数
relation_families 列表 涉及的关系族

奖励机制

  • 当且仅当 parse_answer(completion, answer_format) == gold_answer 时得分为 1.0
  • text 格式:原始字符串
  • candidate_label 格式:原始标记(A/B/C/…)
  • coordinate 格式:保留 6 位小数的浮点数三元组
  • 无法解析的输出得分为 0.0

数据配置(Configs)

数据集包含 5 个配置,每个配置均只有训练分割:

配置名 样本数 主要特征
sft_traces_v1 275 行ID、提示、轨迹、跳数、工具名、答案格式、标准答案、压缩标记
sft_traces_v2 308 在 v1 基础上增加提示/完成令牌数
v2_curriculum 2100 提示、答案格式、标准答案、逻辑跳数
v3_curriculum 1429 提示、答案格式、标准答案、逻辑跳数
v4_10k 13014 提示、标准答案、答案格式、逻辑跳数、分割、来源ID/代码、几何跳数

数据来源

该数据集由 CAD-QA 流水线(AST/数据流图 + CadQuery 执行)从公开的 CADEvolve 源代码语料库合成生成。不包含任何人类数据或个人数据

使用方式

python from datasets import load_dataset ds = load_dataset("MRiabov/cadqa-rl-2000") # 分割:train (2000),validation (98)

搜集汇总
数据集介绍
cadqa-rl-2000 数据集图片
构建方式
本数据集源于CAD-QA基准测试的release_10k训练子集,聚焦于cad_browsecomp难度层级,通过CAD-QA管线的AST与数据流图分析及CadQuery实际执行,从公开的CADEvolve源语料中合成生成。每个样本均以闭卷形式呈现,包含一段CadQuery脚本及针对其生成几何体的疑问,答案具备可精确校验的特性。数据划分提供2000条训练样本和98条验证样本,后者源自基准测试的评估切片,明确指示不得用于训练。
特点
数据集的显著特征在于其强化学习训练导向,内置可验证奖励机制,要求模型输出的答案与JSON编码的金标准完全匹配。依据答案形态,数据集区分了text、candidate_label与coordinate三种格式,坐标答案需精确至小数点后六位。样本附带逻辑推理跳数与几何推理跳数,以及所涉及的关联家族列表,为分析模型推理路径提供了细粒度维度。
使用方法
使用者可借助HuggingFace datasets库便捷加载,以splits区分训练与验证集。在强化学习场景中,奖励函数依据完成文本的解析结果与金标准比对决定得分,解析规则严格依照answer_format字段。推荐将输出经json.loads解码后对照,确保评估的一致性与公平性。
背景与挑战
背景概述
cadqa-rl-2000数据集由MRiabov团队于2024年创建,源自CAD-QA基准的release_10k训练分割,聚焦于计算机辅助设计(CAD)中的几何推理任务。该数据集包含2000个闭卷问题,每个问题由CadQuery脚本和关于生成几何体的疑问构成,答案可精确匹配验证,专为强化学习(RL)中的可验证奖励设计。其核心研究问题在于利用程序合成与执行追踪生成高质量的几何推理训练数据,以提升模型在CAD环境中的空间理解与多跳推理能力。该数据集通过提供结构化的问题-答案对及逻辑跳数标注,填补了CAD领域缺乏RL-ready标注数据的空白,对推动几何推理与语言模型结合的研究具有重要价值。
当前挑战
当前面临的主要挑战包括领域问题与构建过程两方面。领域上,CAD几何推理需模型从代码脚本中抽象空间关系,进行多步逻辑推导,而精确匹配答案要求模型输出严格一致,对坐标、标签等格式的解析尤为严苛,且训练数据仅2000条,难以覆盖多样化的几何构型与推理模式,易导致过拟合及泛化能力不足。构建过程中,数据集依赖AST/数据流图分析与CadQuery执行生成,流程复杂且需确保答案的可验证性,同时需设计不同难度梯度的课程(如v2_curriculum、v3_curriculum)以适配渐进式学习,但合成数据的噪声、脚本歧义及奖励合约对解析错误零容忍等特性,均对数据质量与RL训练稳定性构成显著挑战。
常用场景
经典使用场景
CAD-QA-RL-2000数据集聚焦于计算机辅助设计(CAD)中的几何推理问答任务,其核心场景在于为强化学习提供可验证奖励的封闭式问题训练样本。该数据集包含CadQuery脚本及其生成几何体的查询,要求模型在仅凭代码与问题的条件下,精确推断出几何属性(如尺寸、拓扑关系或坐标)。典型用法是配合GRPO等策略优化算法,利用精确匹配的奖励信号驱动模型提升多步逻辑推理能力,尤其针对CAD领域特有的空间理解与程序执行追溯。
实际应用
在实际应用中,该数据集可作为CAD智能辅助系统的训练基石,用于开发能够自动解读设计脚本并回答几何查询的AI助手。其精确匹配的奖励契约与结构化提示设计,便于在真实工程软件中集成,支持自动化设计审查、参数化模型验证以及基于自然语言的交互式设计辅助,显著提升从代码到三维空间解析的自动化程度。
衍生相关工作
该数据集衍生的相关工作主要集中在强化学习与程序推理融合的技术路径上,例如基于GRPO的奖励信号设计、多步推理轨迹的课程学习策略,以及跨任务泛化能力评估。此外,它促进了CAD领域基础模型的训练范式演进,衍生出针对空间语言模型、工具调用增强及几何分析回溯的研究方向,为构建通晓工程语义的下一代AI系统铺垫了数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务