VOE-Bench
收藏资源简介:
VOE-Bench是一个用于评估自驱动实验室智能体证据获取能力的基准测试数据集。该数据集基于美国国家标准与技术研究院(NIST)AM Bench项目公开的真实实验室记录构建,通过重放实际实验决策时刻来创建有限记录分支环境。数据集包含两个配置:default配置包含104个任务,主要评估智能体在已有实验室证据基础上得出可靠结论的能力;v2配置包含110个任务,分为6个任务家族,重点评估智能体在证据获取循环中的决策能力,包括选择存档测量、验证数据来源、选择预运行设计单元以及决定何时停止、升级或拒绝等决策。每个任务都重放了NIST增材制造档案中的实际决策时刻,环境仅揭示实验室实际记录的内容,不进行任何模拟或插值。数据集的评估基于对真实NIST档案的确切遗憾值计算,同时考虑引用纪律、来源验证和校准拒绝等因素。数据集适用于自驱动实验室、材料科学、证据重放和智能体决策评估等研究领域。
数据集概述
VOE-Bench 是一个用于评估智能体在真实实验环境中处理证据能力的基准数据集,涵盖从证据获取到决策的多个环节。数据集分为两个配置:default(原始版本,104个任务)和 v2(升级版本,110个任务),两者分数不可直接比较。
数据集结构与配置
default配置:包含train、validation和test三个拆分,数据文件位于data/目录下(train.jsonl、validation.jsonl、test.jsonl)。v2配置:仅包含test拆分,数据文件为v2/data/tasks.jsonl。
v2 版本核心特性
VOE-Bench 2 评估智能体在自主驾驶实验室环境中执行证据获取循环的能力,包括:选择存档测量、验证来源、选择预运行设计单元、以及决定何时停止、升级或拒绝。所有轨迹均基于真实 NIST 增材制造档案计算精确遗憾值,无任何模拟器参与。
任务家族
| 任务家族 | 任务数 | 评估的决策类型 |
|---|---|---|
recorded_measurement_selection |
40 | 在仪器成本预算下选择下一个存档测量 |
provenance_event_log_repair |
25 | 定位并处理来源或事件日志缺陷 |
finite_design_cell_selection |
19 | 从记录的过程网格中选择预运行设计单元 |
deep_characterization_escalation_partial |
12 | 决定何时升级到深度表征而非提交 |
measurement_model_ood_partial |
10 | 决定何时声明测量模型超出范围 |
missing_evidence_localization_control |
4 | 定位单条缺失记录(简易控制切片) |
发布内容
v2 版本包含以下文件与目录:
v2/data/tasks.jsonl:任务表面数据(初始状态、动作菜单、任务元数据,不含答案字段)v2/environment/:记录分支、有限网格和仪器成本环境模块(可审计参考,非独立运行器)v2/scorer/:冻结的评分器和追踪/动作合同源码v2/metadata/baseline_stats.json:确定性参考策略和基线策略的聚合统计v2/metadata/validation_report.json:发布泄漏和排除检查报告v2/metadata/cleanroom_reproduction.json:发布构建的独立重现记录v2/metadata/release_manifest.json:所有 v2 发布文件的 SHA-256 哈希值v2/metadata/nist_sources.json:NIST 来源和引用元数据
使用示例
加载默认配置: python from datasets import load_dataset v1 = load_dataset("Dynamical-Systems/VOE-Bench")
加载 v2 配置: python from datasets import load_dataset v2 = load_dataset("Dynamical-Systems/VOE-Bench", "v2")
检查 v2 任务表面: python tasks = load_dataset("Dynamical-Systems/VOE-Bench", "v2")["test"] row = tasks[0] print(row["family"], row["action_space"]) print(row["policy_surface"])
边界声明
VOE-Bench 2 是一个基于记录分支的回放基准:智能体可观测的每个结果均由 NIST 实际测量并归档,基准的权威性止于该档案。它不是密封基准、不是任何部件或工艺的资质认证、也不代表任何策略可在此训练。所有工件均设置 training_allowed=false、training_admitted=false、rl_admitted=false。
限制与注意事项
- AMB2025-06/07 提示:该任务的公共解决方案于 2025-12-18 发布,行为污染检查呈阴性,但该警告永久有效,相关结果必须单独标注。
- 评分限制:v2 的
test拆分仅为传输标签,内部治理拆分标签未发布。进行评分评估需联系作者获取持留的验证表。 - v1 兼容性:原始
default配置及其 104 个任务保持不变,可用于重现 v1 博客文章中描述的已实现证据基准。
数据来源与引用
数据集源自公开的 NIST AM Bench 记录,引用时需注明对应的 NIST 数据出版物:
- AMB2025-02 tensile data — mds2-3735
- AMB2025-03 fatigue data — mds2-3734
- AMB2025-06/07 laser-pads calibration data — mds2-3707
- AMB2022/2025-09 source record — mds2-3759
许可协议
编译后的基准(任务打包、源码封装、元数据和文档)采用 CC BY 4.0 许可。底层 NIST AM Bench 记录为公共数据,保留其适用的 NIST 条款。




