VEHBench
收藏资源简介:
VEHBench是由香港科技大学(广州)研究团队构建的工程原生诊断基准数据集,专注于评估大语言模型在振动能量收集器协同设计中的辅助能力。该数据集包含763个基于文献的任务案例,通过分析物理预言机进行评分,涵盖了规格分类、验证器引导搜索、损坏状态恢复和政策条件选择四个设计阶段。数据集创建过程涉及文献审计、物理验证和阶段本地化探针生成,旨在解决耦合物理约束下工程工作流程的阶段性行为评估问题,为改进基于验证器的工程大语言模型提供阶段感知基础。
VEHBench is an engineering-native diagnostic benchmark dataset developed by the research team from The Hong Kong University of Science and Technology (Guangzhou). It focuses on evaluating the auxiliary capabilities of Large Language Models (LLMs) in the co-design of vibration energy harvesters. This dataset contains 763 literature-based task cases, which are scored via analysis of physical oracles, covering four design stages: specification classification, verifier-guided search, faulty state recovery, and policy condition selection. The dataset creation process involves literature auditing, physical validation, and stage-specific probe generation, aiming to address the challenge of staged behavior evaluation for engineering workflows under coupled physical constraints, and provide a stage-aware foundation for improving verifier-based engineering LLMs.
VEHBench 数据集概述
基本信息
- 许可证:CC-BY-4.0
- 语言:英语
- 大小:少于 1000 个样本
- 标签:基准测试、大语言模型、工程设计、振动能量采集器、验证器基准确评估
数据集简介
VEHBench 是一个阶段性局部诊断基准,用于评估大语言模型在验证器门控物理约束下辅助振动能量采集器(VEH)协同设计的能力。数据集包含 763 个 VEH 任务 和 106 个电路构建有效性审计任务,涵盖四个探针。
命名说明
- VEHBench 是面向论文的基准和数据集名称。
diagbench是实现包、代码命名空间和历史运行器前缀,用于导入稳定性和哈希稳定的原始日志。- 两者指代相同的已发布基准,混合命名不表示独立数据集或不同的任务库。
数据集摘要
| 探针 | VEH 任务数 | 电路任务数 | 关键指标 | 测试内容 |
|---|---|---|---|---|
| P1 | 240 | 32 | P1-Composite | 入口分类:提出方案、请求缺失信息或声明不可行 |
| P2 | 208 | 32 | 最终可行功率比 | 基于验证器反馈的设计搜索 |
| P3 | 156 | 18 | P3-Success | 从损坏轨迹状态中恢复 |
| P4 | 159 | 24 | 完整 Kendall Tau | 策略条件化的可行方案排序 |
总共:763 个 VEH 任务,106 个电路任务。
文件结构
data/veh/p1_tasks.jsonl至p4_tasks.jsonl:最终 VEH 任务库data/veh/splits/:开发集、分布内测试集和分布外测试集划分清单data/circuit/p1_tasks.jsonl至p4_tasks.jsonl:最终电路审计任务库data/manifests/release_manifest.json:计数、字节大小、SHA256 哈希和发布溯源信息code/src/diagbench/physics/:封闭形式 VEH 预言机和参考求解器code/src/diagbench/domains/circuit/:封闭形式电路预言机和公共电路构建器/评估器code/src/diagbench/evaluation/:P1-P4 评分器code/scripts/:公共构建、评估、特征提取和 CMA-ES 校准脚本prompts/:P1-P4 提示词模板和受控提示词审计模板results/model_outputs/:匿名化原始 JSONL 输出results/analysis/:汇总表格、审计输出和特征得分docs/:数据表、工件声明、构建审计和复现指南
任务生成与评分
- VEH 任务来自精心策划的 VEH 集合,由
diagbench.physics.oracle评分。 - 没有独立的
domains/veh包:VEH 是基准的主要物理领域,domains/circuit是辅助的构建有效性审计。
复现评分
需使用 prompts/ 中的提示词模板,将模型响应保存为指定 JSONL 格式,并使用公共评估器评分。已包含原始 JSONL 日志以确保快照可复现。
许可信息
- 代码:MIT 许可证
- 数据、提示词、日志和文档:CC-BY-4.0
- 引用元数据:
CITATION.cff - MLCommons Croissant 元数据:
croissant.json
预期用途
VEHBench 旨在用于工程代理诊断、验证器门控工作流评估和响应控制特征分析的研究,不适合生产安全认证或非监督式工程部署。
联系信息
审稿期间保持匿名。




