遇见数据集

VOE-Bench

收藏
Hugging Face2026-07-10 更新2026-07-11 收录
官方服务:

资源简介:

VOE-Bench是一个用于评估自驱动实验室智能体证据获取能力的基准测试数据集。该数据集基于美国国家标准与技术研究院(NIST)AM Bench项目公开的真实实验室记录构建,通过重放实际实验决策时刻来创建有限记录分支环境。数据集包含两个配置:default配置包含104个任务,主要评估智能体在已有实验室证据基础上得出可靠结论的能力;v2配置包含110个任务,分为6个任务家族,重点评估智能体在证据获取循环中的决策能力,包括选择存档测量、验证数据来源、选择预运行设计单元以及决定何时停止、升级或拒绝等决策。每个任务都重放了NIST增材制造档案中的实际决策时刻,环境仅揭示实验室实际记录的内容,不进行任何模拟或插值。数据集的评估基于对真实NIST档案的确切遗憾值计算,同时考虑引用纪律、来源验证和校准拒绝等因素。数据集适用于自驱动实验室、材料科学、证据重放和智能体决策评估等研究领域。

创建时间:
2026-07-01
原始信息汇总

数据集概述

VOE-Bench 是一个用于评估智能体在真实实验环境中处理证据能力的基准数据集,涵盖从证据获取到决策的多个环节。数据集分为两个配置:default(原始版本,104个任务)和 v2(升级版本,110个任务),两者分数不可直接比较。

数据集结构与配置

  • default 配置:包含 trainvalidationtest 三个拆分,数据文件位于 data/ 目录下(train.jsonlvalidation.jsonltest.jsonl)。
  • v2 配置:仅包含 test 拆分,数据文件为 v2/data/tasks.jsonl

v2 版本核心特性

VOE-Bench 2 评估智能体在自主驾驶实验室环境中执行证据获取循环的能力,包括:选择存档测量、验证来源、选择预运行设计单元、以及决定何时停止、升级或拒绝。所有轨迹均基于真实 NIST 增材制造档案计算精确遗憾值,无任何模拟器参与。

任务家族

任务家族 任务数 评估的决策类型
recorded_measurement_selection 40 在仪器成本预算下选择下一个存档测量
provenance_event_log_repair 25 定位并处理来源或事件日志缺陷
finite_design_cell_selection 19 从记录的过程网格中选择预运行设计单元
deep_characterization_escalation_partial 12 决定何时升级到深度表征而非提交
measurement_model_ood_partial 10 决定何时声明测量模型超出范围
missing_evidence_localization_control 4 定位单条缺失记录(简易控制切片)

发布内容

v2 版本包含以下文件与目录:

  • v2/data/tasks.jsonl:任务表面数据(初始状态、动作菜单、任务元数据,不含答案字段)
  • v2/environment/:记录分支、有限网格和仪器成本环境模块(可审计参考,非独立运行器)
  • v2/scorer/:冻结的评分器和追踪/动作合同源码
  • v2/metadata/baseline_stats.json:确定性参考策略和基线策略的聚合统计
  • v2/metadata/validation_report.json:发布泄漏和排除检查报告
  • v2/metadata/cleanroom_reproduction.json:发布构建的独立重现记录
  • v2/metadata/release_manifest.json:所有 v2 发布文件的 SHA-256 哈希值
  • v2/metadata/nist_sources.json:NIST 来源和引用元数据

使用示例

加载默认配置: python from datasets import load_dataset v1 = load_dataset("Dynamical-Systems/VOE-Bench")

加载 v2 配置: python from datasets import load_dataset v2 = load_dataset("Dynamical-Systems/VOE-Bench", "v2")

检查 v2 任务表面: python tasks = load_dataset("Dynamical-Systems/VOE-Bench", "v2")["test"] row = tasks[0] print(row["family"], row["action_space"]) print(row["policy_surface"])

边界声明

VOE-Bench 2 是一个基于记录分支的回放基准:智能体可观测的每个结果均由 NIST 实际测量并归档,基准的权威性止于该档案。它不是密封基准、不是任何部件或工艺的资质认证、也不代表任何策略可在此训练。所有工件均设置 training_allowed=falsetraining_admitted=falserl_admitted=false

限制与注意事项

  • AMB2025-06/07 提示:该任务的公共解决方案于 2025-12-18 发布,行为污染检查呈阴性,但该警告永久有效,相关结果必须单独标注。
  • 评分限制:v2 的 test 拆分仅为传输标签,内部治理拆分标签未发布。进行评分评估需联系作者获取持留的验证表。
  • v1 兼容性:原始 default 配置及其 104 个任务保持不变,可用于重现 v1 博客文章中描述的已实现证据基准。

数据来源与引用

数据集源自公开的 NIST AM Bench 记录,引用时需注明对应的 NIST 数据出版物:

许可协议

编译后的基准(任务打包、源码封装、元数据和文档)采用 CC BY 4.0 许可。底层 NIST AM Bench 记录为公共数据,保留其适用的 NIST 条款。

搜集汇总
数据集介绍
VOE-Bench 数据集图片
构建方式
VOE-Bench以美国国家标准与技术研究院(NIST)增材制造公共档案库中的真实实验记录为基石,构建了一个基于有限记录分支回放的基准测试框架。其核心设计在于,将实验室自主决策过程中遭遇的每一个关键节点,均作为一项独立任务进行封装。具体而言,数据集从NIST AM Bench记录中截取决策时刻,将它们重塑为精细化的有限记录分支环境,其中包含已归档的测量数据、证据表面以及预运行的设计单元。每个任务均以JSON格式呈现智能体可观察到的完整初始状态与行动菜单。数据集提供了default与v2两个配置,前者包含104项任务,侧重评估智能体根据已有证据得出可靠结论的能力;后者则包含110项任务,跨越六个决策系列,将评估焦点迁移至上游的“下一步应获取何种证据”的决策过程。
特点
VOE-Bench最显著的特点在于其绝对的真实性:环境中所有可供智能体观测的结果,均源自NIST实验室的实际物理测量与归档记录,整个评估回路中不引入任何模拟或插值环节。智能体只能在预设的档案测量、证据表面及设计单元中进行选择,任何超出菜单的请求均被标记为不可用。评分机制采用精确遗憾值(exact regret),通过与最优可达路径的对比来衡量性能,同时严格约束引用纪律(仅能引用实际获取的证据)、来源检查(在信任或标记来源前必须核实其真实性)以及校准性拒绝(仅在档案确实无法支撑决策时,放弃作答才能得分)。所有发布文件均附带SHA-256哈希校验清单,保证了数据的可审计性与复现性。
使用方法
VOE-Bench可通过Hugging Face的datasets库便捷加载,使用load_dataset函数并指定相应配置即可获取任务表面。每个任务包含任务家族标签、行动空间定义以及智能体允许观察的完整策略表面。智能体被视为一个映射函数,它在每一轮根据当前策略表面选择一个行动,包括请求测量、检查来源、选择设计单元格、提交结论、升级分析、声明超出范围或放弃作答,直至采取终止行动。由于评分需要访问未公开发布的、包含真实结果的归档表格,因此完整的有评分评估需要通过联系作者以保密方式进行。用户可基于已发布的环境与评分器源代码,审计过渡逻辑与奖励机制。
背景与挑战
背景概述
VOE-Bench由Dynamical Systems团队于2026年创建,旨在评估自主驾驶实验室(self-driving laboratories)中智能体处理真实实验证据的能力。该数据集基于美国国家标准与技术研究院(NIST)公开的增材制造(AM Bench)档案,构建了104项原始任务和110项扩展任务,核心研究问题聚焦于智能体能否在缺乏模拟环境的条件下,依据真实实验室记录做出证据充分、可溯源的决策。VOE-Bench在材料科学和自动化实验领域具有重要影响力,它首次将回放基准(replay benchmark)应用于证据获取循环的测量,推动了从“能否总结已有证据”到“能否主动决定下一步获取何种证据”的范式转变,为自驱动实验室的智能体可靠性提供了标准化评估框架。
当前挑战
VOE-Bench所解决的领域问题包括:在自驱动实验室中,智能体需要超越传统的实验设计优化,应对真实档案不完整、来源不可靠以及测量成本约束等复杂决策场景。具体挑战涵盖:1)在有限的仪器预算下,从已存档测量中选择最优下一步请求(recorded_measurement_selection);2)定位并修复来源或事件日志缺陷(provenance_event_log_repair);3)从过程网格中选择预运行设计单元(finite_design_cell_selection);4)判断何时升级至深度表征而非直接提交结果(deep_characterization_escalation_partial);5)判定测量模型是否超出适用范围(measurement_model_ood_partial);6)定位缺失证据记录(missing_evidence_localization_control)。构建过程中,团队面临确保基准不可用于训练、防止答案泄露以及维护引用纪律的挑战,最终通过仅发布任务表面信息、保留评分答案表的方式实现审计透明与评估安全之间的平衡。
常用场景
经典使用场景
在材料科学与自动化实验室的前沿交叉领域,VOE-Bench作为首个聚焦于自驱动实验室智能体证据获取与决策能力的基准数据集,其最经典的使用场景在于评估AI系统在真实实验证据下的推理与决策效能。具体而言,该数据集以美国国家标准与技术研究院(NIST)公开的增材制造实验档案为基石,通过v1版本检验智能体在已有实验证据中能否得出“可辩护的结论”,以及v2版本测评智能体在证据不完整时如何判断“下一步该获取哪些证据”。这一设计直接对标了自驱动实验室运行中的核心挑战——智能体需在有限预算下从存档测量、证据来源和预运行设计单元中做出选择,并决定何时停止、升级或拒绝。因此,VOE-Bench为自驱动实验室智能体的鲁棒性评估提供了标准化、可重复的试验场,推动了该领域从概念验证向可靠实用迈进的步伐。
实际应用
VOE-Bench的实际应用场景紧密围绕现代材料研发实验室的自动化转型需求,尤其是在工业级增材制造和先进合金开发等高风险、高成本领域。具体而言,该数据集可用于验证和优化自驱动实验室系统中的“实验调度智能体”——这类智能体需自动决定下一步应运行哪个实验、验证哪份数据来源的可靠性,或从已有的设计空间中挑选最优先的候选方案。例如,在NIST的AM Bench项目中,智能体需在有限的仪器时间与材料成本下,从数十个预运行设计单元中选择下一步测量的对象,或在发现数据异常时决定是否升级到深度表征技术,而非盲目继续提交。这种决策不仅影响实验效率,更直接影响结论的可靠性。因此,VOE-Bench为自动实验平台供应商、材料数据库开发者和航空航天等高端制造企业提供了测试和校准实验室决策系统的关键参照,帮助将AI驱动的“假设-验证”循环从学术演示推向工程实践。
衍生相关工作
VOE-Bench的发布催生了多个方向的研究工作,其中最显著的衍生成果集中在自驱动实验室智能体的决策架构设计、不确定性感知的主动学习算法,以及面向实验规划的可解释性评估方法上。首先,通过与Dynamical Systems团队前沿模型的对比分析,研究者得以量化大型语言模型在真实实验证据下的推理能力边界,并据此提出了基于“证据回放”(evidence replay)的改进训练策略。其次,该数据集严苛的“无模拟器”设定——所有结果均来自真实NIST档案而非插值或模拟——促使学术社区重新审视并开发了更注重数据来源可靠性和引用纪律的智能体框架。此外,v2版本中“精准遗憾”评分与“校准拒绝”机制的结合,激发了一系列关于智能体在证据不足时如何优雅退出的理论探索,这在安全关键的材料制造场景中尤为重要。这些衍生工作不仅深化了我们对AI在科学发现循环中角色的理解,更为未来构建更自主、更可信的实验系统奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务