SimBench
收藏资源简介:
SimBench是由威斯康星大学麦迪逊分校开发的,用于评估学生大型语言模型(S-LLMs)生成数字孪生(DTs)能力的基准数据集。该数据集包含102个示例,分为34个不同的物理系统,每个系统有三个演示,从简单到复杂。数据集的创建过程经过精心设计,由模拟专家手动策划。SimBench主要应用于虚拟测试领域,旨在解决自动生成高质量数字孪生模型的挑战。
SimBench is a benchmark dataset developed by the University of Wisconsin–Madison for evaluating the capability of student large language models (S-LLMs) to generate digital twins (DTs). It consists of 102 examples spanning 34 distinct physical systems, with three demonstrations for each system ranging from simple to complex. The dataset was developed through a meticulously designed process, with manual curation performed by simulation experts. Primarily applied in the field of virtual testing, SimBench aims to address the challenge of automatically generating high-quality digital twin models.
SimBench 数据集概述
数据集描述
SimBench 是一个用于评估学生大型语言模型(S-LLMs)生成数字孪生(DTs)质量的基准测试。该基准测试通过多轮交互,利用基于规则的判断型大型语言模型(J-LLM)来评估 S-LLMs 生成的 DTs 质量,从而提供一致且受专家启发的评估协议。
应用场景
SimBench 主要用于以下几个方面的模拟测试:
- 多体动力学(MBD):涉及多连杆臂、齿轮机构、曲柄滑块系统等典型机制的碰撞、接触和摩擦动力学。
- 有限元分析(FEA):涉及电缆、梁、壳体、板等结构分析的振动、变形、应力和应变。
- 车辆动力学(VEH):使用城市公交车、越野车辆(如 HMMWV、M113)、卡车(如 Kraz、MAN)和轿车来测试 S-LLM 的驾驶场景模拟能力。包括驾驶员、发动机、传动和轮胎模型,以及与传感器集成的高级控制策略。
- 传感器集成(SEN):涉及 GPS、IMU、LiDAR 和摄像头传感器,用于测试 S-LLM 在自动驾驶车辆和机器人系统中的感知任务支持能力。
- 机器人动力学(RBT):涉及 Turtlebot、Curiosity 和 VIPER 等机器人系统,以及颗粒动力学和可变形地形模拟,例如用于机器人和车辆越野操作的土壤接触模型(SCM)。
数据集结构
SimBench 包含 102 个演示任务,涉及 34 个不同类别的物理系统,涵盖从 MBD 到 RBT 的各个方面。这些任务涉及设置和逐步修改数字孪生,每个任务分为三个高质量的轮次,由模拟专家设计,逐渐增加复杂性,以便 J-LLM 提供对 S-LLM 能力的稳健评估。
评估流程
SimBench 的评估流程如下:
- 使用验证集对 J-LLM 进行校准,该验证集包含真实数据和生成数据的配对。
- 交互式优化提供给 J-LLM 的提示,以匹配专家提供的分数。
- 使用 J-LLM 根据生成的 DTs、真实 DTs 和 API 文档来评估 S-LLM。

- 1SimBench: A Rule-Based Multi-Turn Interaction Benchmark for Evaluating an LLM's Ability to Generate Digital Twins威斯康星大学麦迪逊分校 · 2024年



