遇见数据集

dev404ai/DEMM-Bench

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

DEMM-Bench是一个跨制度基准测试,用于评估代理运行时系统的治理证据充分性。它测量代理运行时系统发出的记录(如跟踪、分类账、来源图、策略日志、委托令牌、缓存事件、工具防火墙记录)是否足以回答关于特定决策的治理问题,而不仅仅是存在。该基准测试基于决策证据成熟度模型(DEMM),采用保证案例传统,进行属性级评分。它通过适配器标准化来自八个证据制度的记录,并针对八个决策属性(如行动者身份、主体权限、行动边界、策略基础等)提出治理问题。数据集包含64个案例的确定性包,应用八个确定性退化条件(如完整、缺少委托、缺少策略、缺少上下文等)引入受控证据缺口,然后进行评分。指标包括过声称率(主要诊断)、属性充分性准确性(PSA)、欠声称率和充分声称率。默认基线包括五个容器存在基线,如跟踪存在、分类账存在、模式存在等。数据集布局包括案例数据、注释、预言机构建规则文件、语料库清单、参考候选评分器输出和证据源记录。数据集使用Creative Commons Attribution 4.0 International许可,代码和规则使用Apache License 2.0。

DEMM-Bench is a cross-institutional benchmark designed to evaluate the adequacy of governance evidence for agent runtime systems. It measures whether the records emitted by agent runtime systems—including traces, ledgers, provenance graphs, policy logs, delegation tokens, cache events, and tool firewall logs—are sufficient to answer governance questions about specific decisions, rather than merely proving their existence. This benchmark is based on the Decision Evidence Maturity Model (DEMM), adopts the assurance case tradition, and conducts attribute-level scoring. It standardizes records from eight evidence regimes via adapters, and poses governance questions targeting eight decision attributes such as actor identity, subject permissions, action boundaries, policy foundations, etc. The dataset contains deterministic bundles of 64 cases, introduces controlled evidence gaps by applying eight deterministic degradation conditions (e.g., complete, missing delegation, missing policy, missing context, etc.), and then performs scoring. The metrics include over-claim rate (primary diagnostic metric), Property Sufficiency Accuracy (PSA), under-claim rate, and proper-claim rate. The default baselines include five container existence baselines, such as trace existence, ledger existence, schema existence, etc. The dataset layout includes case data, annotations, oracle construction rule files, corpus manifest, reference candidate scorer outputs, and evidence source records. The dataset is licensed under Creative Commons Attribution 4.0 International, while the code and rules are licensed under Apache License 2.0.

提供机构:
dev404ai
搜集汇总
数据集介绍
dev404ai/DEMM-Bench 数据集图片
构建方式
DEMM-Bench的构建根植于决策证据成熟度模型(DEMM),通过从八个证据机制(如AER、MAT、PROV等)中提取记录,经由适配器标准化后,针对八项决策属性(包括行为者身份、主体权限、行动边界等)提出治理问题。每个案例均施加八种确定性退化条件(如完整、缺失委托、缺失策略等),以模拟受控的证据缺口。标签由构建预言机规则文件确定性生成,而非人工标注,场景源自AI事件数据库中的合成示例,确保了流程的可复现性与内部一致性。
特点
该基准的核心特点在于衡量代理运行时系统所发出记录(如痕迹、账本、溯源图)对于回答治理问题的充足性,而非仅关注记录的存在性。通过过量声明率、属性充足性准确率等指标,DEMM-Bench揭示了常见的“容器存在即充足”谬误,并在64个案例中展示了属性级评分器将过量声明降至零的显著效果。其标签由规则文件确定性生成,皮尔逊kappa系数达到1.0,凸显了确定性规则的可重复性优势。
使用方法
使用DEMM-Bench时,研究者可加载`manuscript_scorer_input_cases.jsonl`等案例数据,并通过预设的八种退化条件对证据集进行扰动。基准提供了五种容器存在基线(如痕迹存在、账本存在)作为对比参照,用户可运行参考评分器(如决策痕迹重建器)计算过量声明率与属性充足性准确率。代码与完整结果包托管于GitHub和Zenodo仓库,支持在消费级笔记本电脑上于每案例60秒内完成确定性管线的执行。
背景与挑战
背景概述
DEMM-Bench诞生于人工智能治理领域对代理运行时系统(Agent-Runtime System)所产生记录——包括追踪日志、账本、溯源图、策略日志、委托令牌、缓存事件及工具防火墙记录——是否足以回答治理问题的迫切需求之中。该基准测试由决策证据成熟度模型(DEMM)驱动,旨在评估证据充分性而非仅存在性。由相关研究团队于近期开发,核心研究问题聚焦于如何量化代理运行时系统在跨八种证据体制下的治理证据充分性,涵盖八个决策属性与八种确定性退化条件。DEMM-Bench通过过度声明率与属性充分性准确率等指标,为AI治理提供了系统化的评估框架,对推动自主系统可审计性与责任机制的发展具有显著影响力。
当前挑战
DEMM-Bench所解决的领域核心挑战在于,现有系统往往仅确认记录“存在”即视为证据充分,而忽略了其是否足以支撑治理问题的推理,导致过度声明率达75%以上。构建过程中,研究团队面临如何跨八种异质证据体制(如AER、MAT、PROV等)标准化记录的挑战,需设计适配器进行归一化。同时,为引入可控证据缺陷,团队开发了八种确定性退化条件,并构建了基于构造预言规则文件的确定性标签生成机制,以规避人工标注的不一致性。此外,确保基准测试在消费级硬件上高效运行,也是设计中的实际挑战。
常用场景
经典使用场景
在人工智能治理与自主代理系统可靠性评估的交汇处,DEMM-Bench作为一个跨体制基准测试脱颖而出,专门用于衡量代理运行时系统所排放记录(包括追踪数据、账本、溯源图谱、策略日志、委托令牌、缓存事件及工具防火墙记录)在回答特定决策治理问题时的充分性。其经典使用场景聚焦于验证运行时代理产生的证据是否足以支撑决策属性的严格判定,而非仅仅关注证据的存在性。该基准测试通过八种证据体制适配器常态化处理来自不同来源的记录,并在八种决策属性上提出治理问题,施加八种确定性退化条件以引入可控证据缺口,从而对候选评分器进行评分。这一设计使其成为保障案例传统中属性级评分基准的典范,为代理运行时治理证据充分性的评估提供了系统化范式。
实际应用
在实际应用中,DEMM-Bench为构建可靠的AI治理基础设施提供了关键支持。它能够帮助系统开发者识别运行时记录系统中的证据缺口,避免因过度声明治理证据充分性而导致的风险决策。例如,在委托授权追踪中,基准测试可揭示当提及主体但缺失委托信息时,评分器仍错误判定为充分的情况。该基准测试对于金融监管合规、自动化决策系统的审计验证以及多代理协作环境中的责任归属等场景具有直接应用价值。通过提供标准化的证据充分性评分,它支持企业建立更严格的风险管理框架,确保代理系统在关键决策中具备可追溯、可验证的保障链条,从而提升AI系统在日常运营中的安全性与可信度。
衍生相关工作
DEMM-Bench的诞生催生了一系列值得关注的衍生工作。基于其决策证据成熟度模型,研究者开发了适应特定领域(如医疗诊断、自动驾驶)的定制化证据充分性评估方法。基准测试中定义的八种决策属性和退化条件被应用于构建更精细的代理行为审计工具,例如动态能力重放分析器与智能合约合规验证器。此外,其过度声明率指标启发了新一代AI安全仪表盘的开发,这些仪表盘能够实时监控代理系统运行时证据流,并在证据不充分时自动触发预警机制。在学术层面,DEMM-Bench的构造神谕规则文件和配对标注方法论被多篇后续研究采纳,成为建立可复现AI治理基准的新标准,推动了该领域从理论框架向工程实践的实质性跨越。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务