遇见数据集

VEHBench

收藏
arXiv2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

VEHBench是由香港科技大学(广州)研究团队构建的工程原生诊断基准数据集,专注于评估大语言模型在振动能量收集器协同设计中的辅助能力。该数据集包含763个基于文献的任务案例,通过分析物理预言机进行评分,涵盖了规格分类、验证器引导搜索、损坏状态恢复和政策条件选择四个设计阶段。数据集创建过程涉及文献审计、物理验证和阶段本地化探针生成,旨在解决耦合物理约束下工程工作流程的阶段性行为评估问题,为改进基于验证器的工程大语言模型提供阶段感知基础。

VEHBench is an engineering-native diagnostic benchmark dataset developed by the research team from The Hong Kong University of Science and Technology (Guangzhou). It focuses on evaluating the auxiliary capabilities of Large Language Models (LLMs) in the co-design of vibration energy harvesters. This dataset contains 763 literature-based task cases, which are scored via analysis of physical oracles, covering four design stages: specification classification, verifier-guided search, faulty state recovery, and policy condition selection. The dataset creation process involves literature auditing, physical validation, and stage-specific probe generation, aiming to address the challenge of staged behavior evaluation for engineering workflows under coupled physical constraints, and provide a stage-aware foundation for improving verifier-based engineering LLMs.

创建时间:
2026-07-21
原始信息汇总

VEHBench 数据集概述

基本信息

  • 许可证:CC-BY-4.0
  • 语言:英语
  • 大小:少于 1000 个样本
  • 标签:基准测试、大语言模型、工程设计、振动能量采集器、验证器基准确评估

数据集简介

VEHBench 是一个阶段性局部诊断基准,用于评估大语言模型在验证器门控物理约束下辅助振动能量采集器(VEH)协同设计的能力。数据集包含 763 个 VEH 任务106 个电路构建有效性审计任务,涵盖四个探针。

命名说明

  • VEHBench 是面向论文的基准和数据集名称。
  • diagbench 是实现包、代码命名空间和历史运行器前缀,用于导入稳定性和哈希稳定的原始日志。
  • 两者指代相同的已发布基准,混合命名不表示独立数据集或不同的任务库。

数据集摘要

探针 VEH 任务数 电路任务数 关键指标 测试内容
P1 240 32 P1-Composite 入口分类:提出方案、请求缺失信息或声明不可行
P2 208 32 最终可行功率比 基于验证器反馈的设计搜索
P3 156 18 P3-Success 从损坏轨迹状态中恢复
P4 159 24 完整 Kendall Tau 策略条件化的可行方案排序

总共:763 个 VEH 任务,106 个电路任务。

文件结构

  • data/veh/p1_tasks.jsonlp4_tasks.jsonl:最终 VEH 任务库
  • data/veh/splits/:开发集、分布内测试集和分布外测试集划分清单
  • data/circuit/p1_tasks.jsonlp4_tasks.jsonl:最终电路审计任务库
  • data/manifests/release_manifest.json:计数、字节大小、SHA256 哈希和发布溯源信息
  • code/src/diagbench/physics/:封闭形式 VEH 预言机和参考求解器
  • code/src/diagbench/domains/circuit/:封闭形式电路预言机和公共电路构建器/评估器
  • code/src/diagbench/evaluation/:P1-P4 评分器
  • code/scripts/:公共构建、评估、特征提取和 CMA-ES 校准脚本
  • prompts/:P1-P4 提示词模板和受控提示词审计模板
  • results/model_outputs/:匿名化原始 JSONL 输出
  • results/analysis/:汇总表格、审计输出和特征得分
  • docs/:数据表、工件声明、构建审计和复现指南

任务生成与评分

  • VEH 任务来自精心策划的 VEH 集合,由 diagbench.physics.oracle 评分。
  • 没有独立的 domains/veh 包:VEH 是基准的主要物理领域,domains/circuit 是辅助的构建有效性审计。

复现评分

需使用 prompts/ 中的提示词模板,将模型响应保存为指定 JSONL 格式,并使用公共评估器评分。已包含原始 JSONL 日志以确保快照可复现。

许可信息

  • 代码:MIT 许可证
  • 数据、提示词、日志和文档:CC-BY-4.0
  • 引用元数据:CITATION.cff
  • MLCommons Croissant 元数据:croissant.json

预期用途

VEHBench 旨在用于工程代理诊断、验证器门控工作流评估和响应控制特征分析的研究,不适合生产安全认证或非监督式工程部署。

联系信息

审稿期间保持匿名。

搜集汇总
数据集介绍
VEHBench 数据集图片
构建方式
VEHBench的构建根植于对209篇文献的细致审计,从中提取了2090条与悬臂梁式振动能量采集器设计相关的参数字段。经过单元与假设一致性筛查、物理合理性验证以及锚点清洗后,最终保留了52个由文献衍生的设计锚点。基于这些锚点,研究团队将设计工作流拆解为四个阶段:规格分类、验证器引导的搜索、受损状态恢复与策略条件选择,并针对每个阶段生成对应的探测任务。每个任务均通过分析性物理神谕进行确定性评分,确保评估的客观性与可复现性。整个构建流程涵盖文献溯源、自动筛选、神谕复核与清单溯源六大步骤,最终形成了包含763个任务的高质量基准测试集。
特点
VEHBench的核心特点在于其阶段本地的诊断能力。传统基准仅关注最终工件的有效性,而VEHBench通过将设计工作流分解为四个具有不同信任状态、允许动作与失败后果的角色,揭示了各阶段大语言模型能力的显著差异。实验表明,任一模型均无法在所有设计阶段持续领先,其能力随工作流边界的变化而剧烈波动。该基准还通过响应控制轮廓,将表面错误分解为过度行动、反馈条件化、状态重置与策略执行等多种行为模式,从而精确诊断模型在特定设计阶段的失败根源,为模型选择与路由提供了可操作的指导。
使用方法
VEHBench的使用方法遵循明确的阶段本地评估协议。用户需将大语言模型部署至四个角色中:在P1规格分类阶段,模型需根据设计简报判断是否应提出设计、请求缺失信息或声明不可行;在P2搜索阶段,模型需基于种子设计与神谕反馈进行有限编辑,以优化可行候选方案;在P3恢复阶段,模型需从被污染的轨迹中脱离并稳定至可行状态;在P4选择阶段,模型需依据既定策略对可行候选方案进行排序。所有输出通过结构化JSON传递至分析性神谕,返回可行性、目标值及阶段特定反馈。该基准支持分阶段模型选择与路由仿真,为工程应用中的模型适配与接口设计提供了实证依据。
背景与挑战
背景概述
VEHBench是由香港科技大学(广州)物联网学域Depeng Su、Yuyu Luo及Guobiao Hu等研究人员于2026年提出的工程化诊断基准,旨在评估大语言模型在振动能量收集器协同设计中的辅助能力。该基准基于209篇文献提取的52个物理锚点,构建了覆盖规范分诊、验证引导搜索、故障状态恢复及策略选择四个设计阶段的763项任务,并通过解析物理预言机实现确定性评分。作为首个聚焦能量收集器设计流程的阶段感知基准,VEHBench揭示了模型能力在不同设计阶段具有显著依赖性,为工程化LLM的评估、选择与优化提供了可复现的标准化平台。
当前挑战
VEHBench面临的挑战核心在于多物理耦合约束下的设计流程解耦诊断。领域层面,振动能量收集器设计涉及机械-电气强耦合约束,传统基准仅评估最终工件的有效性,无法暴露模型在规范分诊、验证反馈整合、错误轨迹恢复或策略执行等中间阶段的失败模式。构建过程中,209篇文献的参数提取需处理单位缺失、假设矛盾及物理一致性审查,最终仅保留52个可验证锚点;同时需为四个设计阶段分别设计异构的探测协议和评分体系,确保任务具备可审计的物理有效性和诊断特异性,这显著增加了基准构建的复杂性与质量控制难度。
常用场景
经典使用场景
VEHBench作为首个面向振动能量采集器耦合设计的工程原生诊断基准,其经典使用场景在于评估大语言模型在物理约束驱动的设计工作流中不同阶段的行为表现。该基准将复杂的能量采集器协同设计流程解构为规格审核、验证器引导搜索、损坏状态恢复和策略条件选择四个独立角色,通过763个基于文献的探针任务和解析物理预言机打分,量化模型在各设计边界的行动纪律、反馈条件化编辑能力和策略执行水平。这种阶段本地的评估范式使得研究者能够精准定位模型在工程设计辅助中的薄弱环节,而非仅关注最终工件的有效性。
解决学术问题
VEHBench解决了当前工程评估基准中一个关键的方法论缺失:现有基准主要衡量最终工件的有效性,却无法揭示模型在耦合物理设计的不同阶段的行为差异。该基准通过提出的诊断框架,实证表明大语言模型在工程设计中的能力具有强烈的阶段依赖性——没有任何单一模型能持续主导整个工作流。这一发现挑战了将大语言模型视为统一设计体的传统评估观,为理解模型在规范审核、搜索闭合、状态恢复和策略排序等环节的失败模式提供了系统性的分析工具,推动了工程辅助人工智能评价从最终性能向流程行为的范式转变。
衍生相关工作
VEHBench衍生出一系列重要的创新性工作,包括耦合物理约束下的状态接口设计研究和阶段感知工程代理路由策略。特别值得关注的是,该基准推动了对恢复阶段表示失效问题的深入研究——通过将原始轨迹历史替换为验证器编写的状态摘要,实验发现模型平均恢复成功率从50.0%提升至63.2%,级联率从28.1%降低至9.5%。这种状态控制的实证成果启发了后续关于清洁搜索中保轨迹、恢复时净化状态、选择时暴露可行候选的工程化学术探索,为构建更可靠的验证器接地工程语言模型奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务