遇见数据集

StructureClaw-Bench

收藏
arXiv2026-07-16 更新2026-07-18 收录
官方服务:

资源简介:

StructureClaw-Bench是由清华大学土木工程系团队构建的一个可执行结构工程工作流基准数据集,旨在评估人工智能代理在完整工程证据链中的一致性表现。该数据集包含150个精心设计的场景,涵盖标准工作流执行、交互鲁棒性和多模态结构模型重建三大类别,数据以中英文双语提示词均匀分布,并包含类型化断言、参考夹具和多模态输入。数据集的创建过程基于结构工程领域的实际工作流程,通过定义明确的技能、工具和共享工件状态协议,确保每个场景的可追溯性和可执行性。该数据集主要应用于结构工程领域的人工智能代理评估,旨在解决传统评估方法难以验证完整工程工作流一致性的问题,为结构工程智能系统的可靠性提供更严格的诊断基础。

StructureClaw-Bench is an executable structural engineering workflow benchmark dataset developed by the team from the Department of Civil Engineering, Tsinghua University. It is designed to evaluate the consistency performance of AI Agents across the entire engineering evidence chain. This dataset contains 150 meticulously curated scenarios, which fall into three core categories: standard workflow execution, interactive robustness, and multimodal structural model reconstruction. The dataset features uniformly distributed bilingual prompts in both Chinese and English, alongside typed assertions, reference fixtures, and multimodal inputs. The development of StructureClaw-Bench is grounded in the actual operational workflows of the structural engineering domain. Through well-defined protocols for skills, tools, and shared artifact states, it ensures the traceability and executability of every individual scenario. Primarily targeted at the evaluation of AI Agents in the structural engineering field, this dataset addresses the critical limitation of traditional evaluation methods, which struggle to validate the consistency of complete engineering workflows, and provides a more rigorous diagnostic foundation for assessing the reliability of intelligent systems applied in structural engineering.

创建时间:
2026-07-16
原始信息汇总

StructureClaw 数据集概述

基本信息

  • 项目名称:StructureClaw
  • 许可证:MIT
  • 最低 Node.js 版本:20+
  • 主要语言:支持英文和中文

项目定位

StructureClaw 是一个面向 AEC(建筑、工程、施工)工作流的 AI 辅助结构工程工作空间。它能将自然语言描述的结构需求转化为可追溯的工程工作流,流程为:描述 → 草稿模型 → 验证 → 分析 → 规范检查 → 报告。

核心技术架构

  • 前端:Next.js 14 应用
  • 后端:Fastify API,集成 LangGraph 代理运行时
  • 分析工具:Python 分析运行时,支持 OpenSees、PKPM SATWE、YJK 8.0
  • 数据库:SQLite(本地默认数据库)
  • 关键目录
    • frontend/:前端应用
    • backend/:后端 API、代理/聊天流程、Prisma 集成
    • scripts/:启动脚本和 CLI 实现
    • tests/:回归测试
    • docs/:用户手册和协议参考

引擎支持

引擎 技能 适用场景 要求
OpenSees opensees-* 开放的静力/动力/地震/非线性分析 sclaw doctor 准备 Python 分析环境
PKPM SATWE pkpm-static 商业引擎静力检查和 SATWE 对比 本地 PKPM 安装、JWSCYCLE.exe、有效许可证
YJK 8.0 yjk-static YDB 转换、YJK 静力计算、结构化结果提取 本地 YJK 8.0 安装、Python 3.10、有效授权

配置与运行模式

配置文件

  • 主要配置文件:settings.json(位于 ~/.structureclaw/
  • 关键配置字段:server、llm、database、logging、analysis、storage、agent、pkpm、yjk
  • 可通过 SCLAW_DATA_DIR 环境变量覆盖运行时目录

运行模式

  • 引导安装模式:通过 scripts/install.shscripts/install.ps1 安装,自动处理 Node.js 依赖
  • npm 安装模式npm install -g @structureclaw/structureclaw 后使用 sclaw start
  • 源码运行模式:从 GitHub 克隆后使用 ./sclaw start
  • 中国镜像模式:通过 sclaw_cn 命令使用清华 PyPI 和 npmmirror 镜像

API 入口

  • POST /api/v1/agent/run
  • POST /api/v1/chat/message
  • POST /api/v1/chat/stream
  • POST /validate
  • POST /convert
  • POST /analyze
  • POST /code-check
  • GET /engines

工程原则

  • 技能是增强层,而非唯一执行路径
  • 未匹配的技能选择回退到通用无技能建模
  • 用户可见内容必须同时支持英文和中文
  • 前端/后端/分析技能之间的模块边界保持明确

文档资源

  • 英文手册:docs/handbook.md
  • 中文手册:docs/handbook_CN.md
  • 文档中心:docs/README.md
  • 英文参考:docs/reference.md
  • 中文参考:docs/reference_CN.md
  • 中文概览:README_CN.md
  • 贡献指南:CONTRIBUTING.md
  • 路线图:ROADMAP.md
  • 安全政策:SECURITY.md
搜集汇总
数据集介绍
StructureClaw-Bench 数据集图片
构建方式
StructureClaw-Bench的构建以受控场景为核心,涵盖标准工作流执行、交互鲁棒性与多模态结构模型重建三大任务族,共计150个场景。每个场景均配备类型化的断言集合,对路径选择、中间制品、执行流程、交互行为及最终报告提出明确要求,并配套参考夹具以确保可复现的评估基准。所有场景以中英文提示均匀分布,其中多模态部分包含图像与DXF文件输入。
特点
该基准的突出特点在于以可执行工作流为评估单元,而非孤立的问题回答或脚本生成。成功标准要求所有必需断言在一次运行中全部通过,从而迫使智能体构建完整且一致的证据链——从意图解析、模型构建、验证、求解执行到报告生成均须可追溯。这种设计使得工作流级别的失败得以精确定位,并能区分路径选择、制品匹配、后端执行与安全行为等不同维度的故障模式。
使用方法
使用StructureClaw-Bench时,研究者可在自动模式与通用模式间切换,以评估结构化工作流引导带来的系统级提升。评估遵循单次运行、无自动重试的协议,主指标为场景成功率的二元判定。断言级诊断结果可按路由、建模、执行、交互与报告维度分组分析,帮助识别模型重建能力与无效输入处理能力等特定瓶颈。代码与基准数据均已公开,支持独立复现与扩展。
背景与挑战
背景概述
StructureClaw-Bench由清华大学研究团队于2026年创建,核心研究人员包括Sizhong Qin、Yi Gu和Xinzheng Lu等。该基准测试旨在解决结构工程领域大型语言模型评估的根本局限:传统评估仅关注最终答案或脚本生成,忽视了工程工作流中相互依赖的证据链。研究聚焦于一个核心问题——LLM代理能否在从需求解析、模型构建、验证、求解执行、规范检查到最终报告的完整链条中保持一致性。作为结构工程领域首个可执行的、证据链驱动的基准测试,它提供了150个受控场景,覆盖标准工作流、交互鲁棒性和多模态结构模型重建,对推动AI辅助结构工程的可追溯性和可靠性评估具有里程碑意义。
当前挑战
面临的挑战可分为两个层面。在领域问题层面,结构工程评估需要超越单次回答的范式,验证完整的证据链而非孤立输出,这要求代理在路由、人工制品、执行、交互和报告等多个维度同时通过断言检验。在构建过程中,研究团队需要设计受控的工程技能、类型化工具、共享的构件状态和本地分析后端,同时应对三种任务族——标准工作流、交互鲁棒性和多模态重建——的差异化需求。特别是交互鲁棒性中无效数值输入的安全处理和多模态场景中与参照基准一致的构件重建成为最突出的难点,前者涉及约束检查和安全状态转换,后者则暴露出从感知到路由再到人工制品重建之间的显著鸿沟。
常用场景
经典使用场景
在结构工程领域,大型语言模型驱动的智能体正逐步从单一问答系统迈向复杂工作流的自动化执行。StructureClaw-Bench作为一项基于可执行工件的基准测试,其最经典的用途在于评估智能体在完整结构工程证据链上的端到端表现,涵盖从需求解读、结构模型构建、参数校验、求解器调用、规范校核直至最终报告生成的完整流程。该基准通过150个精心设计的场景,系统性地检验智能体在标准工作流执行、交互鲁棒性以及多模态结构模型重建等维度的能力,确保每个环节的中间产物均可追溯、可验证。
衍生相关工作
StructureClaw-Bench的提出催生了一系列后续研究,推动了结构工程智能体评测体系的深化。围绕其工件中心化的评测理念,学界发展出更细粒度的拓扑级模型匹配算法、面向工程等价性的参考夹具库、以及结合视觉感知与结构推理的多模态重建管线。此外,该基准暴露的连续梁案例性能退化问题,直接引发了关于结构特异性路由策略与回退机制的研究。同时,其对无效数值输入处理的薄弱环节,也激励了确定性约束检查与安全状态转移机制的专项改进工作,形成了以“证据链完整性”为核心的学术讨论新范式。
数据集最近研究
最新研究方向
在当前结构工程智能化转型的浪潮中,大语言模型驱动的智能体正从单一问答任务迈向完整的、可追溯的证据链工作流。StructureClaw-Bench在此前沿背景下应运而生,它聚焦于结构工程领域智能体的全流程评估,不仅仅考察最终答案的准确性,更严格审视从需求解析、模型构建、验证、求解、规范校核到报告生成这一完整链条中每一环节的连贯性与可执行性。该基准测试包含150个精心设计的场景,覆盖标准工作流执行、交互鲁棒性测试以及多模态结构模型重建等热点方向。其核心意义在于揭示了现有方法在应对无效数值输入、结构模型重构等挑战时的薄弱环节,为研发更可靠、更透明的结构工程设计智能体提供了可量化、可诊断的评估标准,推动了该领域从追求流畅回答到确保工程证据链条完整性的范式转变。
相关研究论文
  • 1
    StructureClaw: Traceable LLM Agents and an Executable Benchmark for Structural Engineering Workflows清华大学·土木工程系 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务