遇见数据集

ConsequenceBench

收藏
github2026-07-28 更新2026-07-29 收录
官方服务:

资源简介:

ConsequenceBench是一个用于评估AI代理在真实世界后果下的通用合成基准数据集。它测试代理是否调查正确的证据、选择正确的行动、避免不安全的影响、保留合法的影响、从故障中恢复,并通过独立的回读证明结果。该基准是代理、模型、框架和治理系统中立的。

ConsequenceBench is a general-purpose synthetic benchmark dataset designed for evaluating AI agents in scenarios with real-world consequences. It assesses whether AI agents investigate appropriate evidence, take correct actions, avoid unsafe impacts, retain legitimate impacts, recover from failures, and validate outcomes via independent retrospective verification. This benchmark is neutral with respect to agents, models, frameworks, and governance systems.

创建时间:
2026-07-27
原始信息汇总

ConsequenceBench 数据集概述

基本信息

  • 数据集地址: ConsequenceBench GitHub 仓库
  • 当前状态: DEVELOPMENT_PREVIEW_NOT_QUALIFIED(0.1.0 版本,为工程和研究基础设施,非生产安全认证或密封基准)
  • 核心定位: 一个通用的人工智能代理合成基准测试,用于评估智能代理在现实世界后果下的表现。

评估内容

ConsequenceBench 关注代理是否能够:

  • 调查正确的证据
  • 选择正确的行动
  • 避免不安全的影响
  • 保留合法的影响
  • 从故障中恢复
  • 通过独立回读证明结果

该基准测试是代理、模型、框架和治理系统中立的。

基准测试范围

场景数量与领域

  • 公开语料库包含 100 个规范场景
  • 覆盖 5 个领域,每个领域 20 个场景:
    • 银行业 (Banking)
    • 医疗保健 (Healthcare)
    • 网络安全 (Cybersecurity)
    • 能源 (Energy)
    • 软件交付 (Software Delivery)
  • 每个领域包含针对四个治理视角的场景:
    • 权威与政策
    • 证据与来源
    • 执行与恢复
    • 延迟后果、义务与补偿

变体与扩展

  • 规范生命周期包生成基础变体、因果姊妹变体和不变性姊妹变体,创建 300 个不可变世界
  • 包含伪造和陈旧记录、身份冲突、冲突权限、时间敏感策略变化、长噪声历史、部分影响、重试、崩溃窗口、延迟回读和补偿行动
  • 所有外部影响均为模拟且评估者可观察的

评估度量

基准测试将以下三个研究保持分离:

  1. 直接代理能力:衡量代理在评估者拥有的合成世界中直接行动
  2. 治理符合性:衡量命名治理构建是否强制执行其声明的生命周期、证据、授权、执行、回读、义务和补偿合同
  3. 冻结候选者增量影响:重放相同不可变候选者通过直接和治理分支,隔离治理层的影响

报告指标包括

  • 任务正确性
  • 后果正确性
  • 不安全影响
  • 合法影响保留
  • 证据基础
  • 恢复
  • 严重失败

开发排行榜

无 Yuvin 治理层

排名 模型 精确决策 正确后果 不安全影响
1 GPT-5.6 Sol (xhigh) 60/100 (60%) 79/100 (79%) 21
2 Gemini 3.6 Flash 32/100 (32%) 41/100 (41%) 59
3 Qwen3.6 35B 23/100 (23%) 23/100 (23%) 73
4 Gemma4 e4b 19/100 (19%) 34/100 (34%) 63

有 Yuvin 治理层

排名 模型 精确决策 正确后果 不安全影响
1 GPT-5.6 Sol (xhigh) 69/100 (69%) 99/100 (99%) 0
2 Gemini 3.6 Flash 58/100 (58%) 100/100 (100%) 0
3 Gemma4 e4b 34/100 (34%) 92/100 (92%) 0
4 Qwen3.6 35B 32/100 (32%) 95/100 (95%) 0

所有四个治理运行均记录为零不安全模拟影响。

快速开始

  • 环境要求: Python 3.11 或更新版本

  • 基本验证命令(无需模型、提供商密钥或网络访问):

    consequencebench validate-scenarios consequencebench public-controls consequencebench pressure-controls consequencebench lifecycle-controls consequencebench lifecycle-reference-controls

  • 材料化和验证确定性 300 世界生命周期包:

    consequencebench lifecycle-materialize-pack --output-dir release/lifecycle-pack consequencebench lifecycle-verify-pack --receipt release/lifecycle-pack/consequencebench-lifecycle-pack.json

评估代理方式

代理通过 JSONL 子进程适配器参与。评估者发送片段,拥有所有工具和源状态,执行预算,记录每次尝试,并通过确定性预言机对结果轨迹评分。

结果报告要求

每个公开结果必须包含:

  • ConsequenceBench 版本、源代码提交、轮子哈希和场景清单哈希
  • 完整的代理实现和模型配置哈希
  • 工具策略、提示、预算、重试、故障、种子和试验清单
  • 所有尝试,包括格式错误的输出和超时
  • 所选研究轨道的单独官方记分卡
  • 硬计数器和置信区间
  • 明确的 DEVELOPMENT_ONLY 或独立合格的声明标签

重要限制

  • 当前为开发预览版,未通过生产安全认证
  • 无供应商特定的治理适配器包含在此仓库中
  • 产品集成必须在此仓库之外运行,并绑定确切的基准工件、候选者工件和治理系统构建

资源链接

许可证

代码和文档采用 MIT 许可证。

搜集汇总
数据集介绍
ConsequenceBench 数据集图片
构建方式
ConsequenceBench是一个面向后果性AI智能体的通用合成基准测试数据集。其构建方式围绕评估智能体在真实世界后果下的决策能力展开,通过创建受评估者控制的合成世界,模拟银行、医疗、网络安全、能源及软件交付等五大领域的100个标准场景。每个领域包含20个场景,并细分为权威与政策、证据与来源、执行与恢复、延迟后果与义务补偿四个治理视角。数据集进一步衍生出基础、因果姐妹及不变性姐妹三类变体,形成300个不可变世界,涵盖伪造记录、身份冲突、时间敏感政策、部分效果、重试、崩溃窗口及补偿行为等复杂情境。所有外部效果均为可模拟且可观察的,确保评估的全面性与可控性。
特点
该数据集的核心特点在于其代理、模型、框架及治理系统的中立性,不依赖任何特定供应商的治理适配器。它严格区分直接代理能力、治理符合度及冻结候选增量效应三个研究维度,避免将任务正确性与后果正确性、不安全效应、合法效应保留、证据基础、恢复及硬性失败等指标合并为单一分数。数据集通过确定性预言机对智能体行为进行多维度评分,强调证据基础而非简单答案正确性,要求智能体证明最终状态而非重复效果。其开发排行榜基于公开的完整证据包,而非摘要分数,确保结果的可复现性与可审计性。
使用方法
使用ConsequenceBench评估智能体时,首先需通过JSONL子进程适配器将候选智能体与评估者控制的合成世界对接。评估者发送事件片段,拥有所有工具及源状态,强制执行预算,记录每次尝试,并由确定性预言机对产生的轨迹进行评分。用户可通过命令行工具运行压力测试或生命周期测试,生成结构化结果文件。提交可复现的开发结果需包含完整的基准版本、智能体配置、模型哈希、工具策略、提示、预算、重试及故障清单,以及所有尝试记录(包括格式错误和超时)。结果需附带独立的官方评分卡、硬计数及置信区间,并由LLM评审者可解释轨迹但不得更改确定性硬分数。公共排行榜提交要求保留所有证据,而非仅聚合分数。
背景与挑战
背景概述
随着人工智能代理在金融、医疗、网络安全、能源及软件交付等高 stakes 领域的部署日益深入,确保其决策与行动不仅正确,更需在真实世界后果下保持安全、可问责与可追溯,已演变为一项关键挑战。在此背景下,Yuvin Labs 于 2025 年推出了 ConsequenceBench(版本 0.1.0),这是一个面向后果性人工智能代理的通用合成基准。其核心研究问题在于:代理能否基于证据进行推理、执行授权动作、避免不良效应、保留合法后果、从故障中恢复,并通过独立回读证明最终状态。该基准独立于模型、框架与治理系统,为评估代理在复杂、动态世界中的综合能力提供了方法论平台,对推动安全可靠的自主系统研究具有潜在影响力。
当前挑战
ConsequenceBench 首先直面领域内的核心挑战:现有基准多聚焦于代理的问答准确性,但忽视了行为对真实世界的改变、授权逻辑及状态证明。为弥补这一缺口,基准需在 100 个规范场景(涵盖 5 个领域,每个领域 20 个场景,并衍生出 300 个不变量世界)中,综合评估代理的决策正确性、后果正确性、不安全效应数、合法效应保留、证据基础、恢复能力与硬故障。构建过程中面临的挑战包括:设计高度合成且可观测的“后果式世界”,以模拟伪造记录、身份冲突、权责矛盾、时效性政策变化及延迟回读等复杂叙事;构建确定性预言机以评分代理轨迹;以及制定严格的证据提交与可重复性协议,确保评估结果的可审计性与可信度。
常用场景
经典使用场景
在人工智能安全评估领域,ConsequenceBench被设计为通用合成基准,用于评测智能体在真实世界后果下的表现。其经典使用场景是通过构建银行、医疗、网络安全、能源及软件交付五个领域共100个经典场景,并要求智能体在模拟世界中执行行动,同时考察其是否调查了正确证据、选择了正确行动、避免非安全影响、保留合法影响、从故障中恢复,并通过独立回读证明结果。研究者可借助JSONL子进程适配器将任意智能体接入基准,获取包含任务正确性、后果正确性、非安全效应等多项维度的详尽评分。这种做法避免了仅依赖单一聚合分数的局限性,使得对智能体在后果导向决策中的表现评估更为全面和可靠。
衍生相关工作
ConsequenceBench的发布催生了一系列衍生研究工作。其提供的100个经典场景与300个不可变世界构成的Lifecycle包,为研究者构建更深层次的因果推理基准奠定了数据基础。基于其公有的确定性预言机与生命周期合约,学界和工业界开发出多种治理适配器与独立审计工具,进一步丰富了AI安全评测工具箱。开发者论坛上涌现了针对特定领域场景的扩展讨论,推动了如银行合规、医疗后果诊断等细分领域的基准变体。此外,开发排行榜的公开数据(如GPT-5.6 Sol、Gemini 3.6 Flash等模型在有/无治理层的对比结果)成为了后续研究分析治理层效果的重要参考,激励了更多关于AI安全治理架构的创新尝试。
数据集最近研究
最新研究方向
ConsequenceBench作为前沿的通用合成基准,致力于评估人工智能代理在真实世界后果下的证据驱动决策能力。该基准聚焦于代理在复杂动态环境中调查正确证据、选择恰当行动、规避非预期危害、维系合法效应、从故障中恢复并验证最终状态的能力。其前沿研究方向涵盖直接代理能力与治理合规性的分离度量,通过配对研究范式揭示治理层对安全性的提升效果。初步开发结果显示,引入治理约束后,所有模型的有害效应降至零,正确后果率大幅跃升至92%以上,凸显了可审计治理机制在防范AI系统风险中的关键价值,为后部署监控与责任归属提供了标准化框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务