遇见数据集

orpheon-structural-dataset

收藏
Hugging Face2026-07-18 更新2026-07-19 收录
官方服务:

资源简介:

ORPHEON Structural Dataset v4 是一个专注于结构工程领域的大规模文本生成数据集,旨在支持人工智能模型在建筑和工程任务中的微调与应用。数据集包含 264,494 个示例,覆盖西班牙语、英语、葡萄牙语、罗马尼亚语和法语五种语言,确保 100% 的语言一致性。数据内容围绕 17 个工程工具(如 search_web、get_normative、lookup_section、verify_bending、design_rc_section 等)的调用展开,涉及 48 个工程类别,包括结构设计、验证、规范查询和项目管理等。v4 版本引入了关键改进:新增 132 个独特的对抗性回答以增强鲁棒性;扩展工具集至 17 个,涵盖网络搜索、规范获取、代理运行、项目验证和计算等功能;木材相关数据基于真实场景,其中 57% 通过验证,15% 失败;完全消除人工类别,确保数据真实性;并将旧工具 query_bim_element 替换为 lookup_section。数据集经过严格验证:所有工具调用均针对真实代码进行 100% 验证,质量分数不低于 0.7,采用多来源交叉验证和 1000 多个独特模板以防止过拟合。数据文件包括完整的组合数据集及标准的训练、验证和测试分割(分别为 211,595、26,449 和 26,450 条记录)。该数据集适用于结构工程相关的文本生成任务,如基于自然语言的工具调用、规范遵循、设计辅助和项目分析,支持多语言环境下的 AI 模型开发与评估。

ORPHEON Structural Dataset v4 is a large-scale text generation dataset focused on the structural engineering domain, designed to support the fine-tuning and application of artificial intelligence models in construction and engineering tasks. The dataset contains 264,494 examples, covering five languages: Spanish, English, Portuguese, Romanian, and French, ensuring 100% language consistency. The content revolves around the invocation of 17 engineering tools (such as search_web, get_normative, lookup_section, verify_bending, design_rc_section, etc.), involving 48 engineering categories including structural design, verification, normative querying, and project management. Version v4 introduces key improvements: addition of 132 unique adversarial responses to enhance robustness; expansion of the toolset to 17, covering functions like web search, normative retrieval, agent execution, project verification, and calculations; wood-related data is based on real scenarios, with 57% validated and 15% failing; complete elimination of artificial categories to ensure data authenticity; and replacement of the old tool query_bim_element with lookup_section. The dataset undergoes rigorous validation: all tool invocations are 100% validated against real code, with quality scores no lower than 0.7, employing multi-source cross-validation and over 1,000 unique templates to prevent overfitting. Data files include the complete combined dataset and standard training, validation, and test splits (211,595, 26,449, and 26,450 records, respectively). This dataset is suitable for text generation tasks related to structural engineering, such as natural language-based tool invocation, normative compliance, design assistance, and project analysis, supporting AI model development and evaluation in multilingual environments.

创建时间:
2026-07-17
原始信息汇总

🏗️ ORPHEON 结构数据集 v4 概述

基本信息

  • 许可证: MIT
  • 语言: 西班牙语、英语、葡萄牙语、罗马尼亚语
  • 数据量: 约 264,494 个样本(介于 100K 至 1M 之间)
  • 任务类别: 文本生成

数据集内容

  • 工具数: 17 种结构工程相关工具
  • 类别数: 48 个类别
  • 包含工具列表:
    • search_web, get_normative, run_agent, validate_project, get_project_summary, get_project_quantities, calculate_duration_days, lookup_section, verify_bending, design_rc_section, verify_timber_bending, verify_bolted_connection, get_seismic_params, verify_shear, classify_section, check_deflection, calculate_footing

版本更新亮点 (v4)

  • 新增 132 个独特对抗性回答(之前为 2 个)
  • 增加 7 个 MCP 工具(总数从 11 个增至 17 个)
  • 100% 语言一致性(支持 ES/EN/PT/RO)
  • Timber 真实模拟:57% 通过,15% 失败
  • 无人工类别(从 2000 个精确类别中移除)
  • 工具替换query_bim_element 已被 lookup_section 替代

质量验证

  • 100% 工具调用经真实代码验证
  • 质量评分 ≥ 0.7
  • 三重交叉验证(3 个以上来源)
  • 抗过拟合:1000+ 个独特模板

数据文件划分

文件 记录数
data/final_dataset_combined.jsonl 264,494
data/final_dataset_train.jsonl 211,595
data/final_dataset_val.jsonl 26,449
data/final_dataset_test.jsonl 26,450

使用示例

python from datasets import load_dataset dataset = load_dataset("rapman/orpheon-structural-dataset", split="train")

适用领域

  • 结构工程
  • 建筑规范(Eurocode、AISC、BIM)
  • 微调(fine-tuning)
搜集汇总
数据集介绍
orpheon-structural-dataset 数据集图片
构建方式
在结构工程领域,高质量数据集对于大语言模型的微调至关重要。ORPHEON Structural Dataset v4 构建自工程规范与设计实践的多源语料,总计包含 264,494 条样本,覆盖 17 种工具调用与 48 个工程类别。其构建过程注重对抗性样本的多样性,将独特对抗性回答从 2 种提升至 132 种,并增加 7 个 MCP 工具(如 search_web、get_normative),使工具总数达到 17 个。数据通过 100% 工具调用代码验证,确保每条样本均可追溯至真实执行逻辑,同时引入超过 1,000 个独立模板以防止过拟合。
使用方法
使用者可通过 Hugging Face Datasets 库便捷加载该数据集,例如使用 dataset = load_dataset("rapman/orpheon-structural-dataset", split="train") 获取训练集。数据以 JSONL 格式存储于 final_dataset_train.jsonl、final_dataset_val.jsonl 和 final_dataset_test.jsonl 三个文件中,分别包含 211,595、26,449 和 26,450 条记录。建议基于 17 种工具(包括 search_web、validate_project 等)构建微调管道,并利用其内置的质量评分(≥0.7)与交叉验证(3 源以上)策略优化模型的结构工程设计能力。
背景与挑战
背景概述
ORPHEON Structural Dataset v4是一个面向结构工程领域的专业数据集,由研究团队于近期创建并发布。该数据集致力于弥合通用大语言模型与专业结构工程知识之间的鸿沟,涵盖欧洲规范、AISC标准及BIM等核心领域,包含264,494个样本、17种工具函数和48个分类类别。其核心研究问题在于如何构建一个高质量、领域内知识密集的文本生成数据集,以支持结构工程师在规范查询、截面验算、抗震参数获取等实际任务中的智能辅助。该数据集通过严格的验证流程和反过拟合设计,显著提升了模型在结构工程领域的专业性与可靠性,为计算力学与人工智能的交叉研究提供了关键基础设施。
当前挑战
该数据集面临的核心挑战在于结构工程领域的高度专业性和知识复杂性。领域问题层面,需要解决通用模型难以准确理解并执行欧洲规范、AISC标准等专业条文的难题,以及在不同语言环境下保持术语一致性的挑战。构建过程中,团队需应对工具调用与真实代码验证的精确匹配问题,确保17种MCP工具的输出可靠;同时需消除人工构造数据的偏见,通过超过1000个独特模板和跨源验证实现反过拟合;此外,还有木结构设计等子任务的现实性模拟,以及维持西班牙语、英语等多语言间100%语境一致性的复杂要求。
常用场景
经典使用场景
在结构工程与建筑信息模型(BIM)深度融合的浪潮中,ORPHEON Structural Dataset为大型语言模型的指令微调提供了专业级语料库。该数据集包含26万余条样本,覆盖17种结构分析工具与48个工程类别,支持西班牙语、英语、葡萄牙语和罗马尼亚语等多语言场景。其经典使用方式是利用工具调用(tool_call)格式,训练语言模型完成截面查询、弯曲验证、抗震参数计算、锚栓连接校核以及地基承载力评估等一系列标准化结构设计任务,从而赋予模型执行工程规范运算的专有能力。
解决学术问题
该数据集直面结构工程领域大语言模型面临的两个核心学术瓶颈:专业知识的准确保留与多步骤推理的可靠性。通过引入对抗性样本、跨语言一致性验证以及基于真实代码的100%工具调用校验机制,ORPHEON数据集有效缓解了模型在数值计算、规范引用和结构验证任务中常见的幻觉问题。其创新的抗过拟合模板策略和3源交叉验证体系,为构建高可信度的工程推理模型奠定了方法论基础,推动了AI辅助结构设计从概念生成向可执行计算的范式跃迁。
实际应用
在实际工程场景中,基于该数据集微调的模型可深度嵌入BIM工作流程,承担自动化结构审查、规范合规校验及施工工期推算等关键职能。例如,结构工程师可借助模型快速查询欧洲规范(Eurocode)或AISC标准下的型钢截面属性,自动生成钢筋混凝土截面配筋方案,并通过校验工具即时获得木梁弯曲、高强螺栓连接等构件的通过/失败判定。这种能力显著缩短了设计迭代周期,降低了人工核查的错误率,尤其适用于多语言协作的国际工程项目群。
数据集最近研究
最新研究方向
在结构工程与人工智能交叉领域,ORPHEON数据集的最新研究方向聚焦于通过大规模指令微调提升大语言模型在建筑规范理解与结构设计任务中的专业能力。该数据集整合了欧洲规范(Eurocode)、美国钢结构协会标准(AISC)以及建筑信息模型(BIM)技术,覆盖17种专业工具与48个结构工程类别,包含超过26万条高质量示例。近期研究热点集中于利用其对抗性样本增强与多语言一致性(西班牙语、英语、葡萄牙语、罗马尼亚语)特性,开发能够执行结构验算、截面分类、地震参数查询及项目验证的智能代理系统,推动生成式AI在自动化结构设计与合规性检查中的实际应用,标志着数据驱动方法在土木工程智能化转型中的关键突破。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务