ConsequenceBench
收藏资源简介:
ConsequenceBench是一个用于评估AI代理在真实世界后果下的通用合成基准数据集。它测试代理是否调查正确的证据、选择正确的行动、避免不安全的影响、保留合法的影响、从故障中恢复,并通过独立的回读证明结果。该基准是代理、模型、框架和治理系统中立的。
ConsequenceBench is a general-purpose synthetic benchmark dataset designed for evaluating AI agents in scenarios with real-world consequences. It assesses whether AI agents investigate appropriate evidence, take correct actions, avoid unsafe impacts, retain legitimate impacts, recover from failures, and validate outcomes via independent retrospective verification. This benchmark is neutral with respect to agents, models, frameworks, and governance systems.
ConsequenceBench 数据集概述
基本信息
- 数据集地址: ConsequenceBench GitHub 仓库
- 当前状态:
DEVELOPMENT_PREVIEW_NOT_QUALIFIED(0.1.0 版本,为工程和研究基础设施,非生产安全认证或密封基准) - 核心定位: 一个通用的人工智能代理合成基准测试,用于评估智能代理在现实世界后果下的表现。
评估内容
ConsequenceBench 关注代理是否能够:
- 调查正确的证据
- 选择正确的行动
- 避免不安全的影响
- 保留合法的影响
- 从故障中恢复
- 通过独立回读证明结果
该基准测试是代理、模型、框架和治理系统中立的。
基准测试范围
场景数量与领域
- 公开语料库包含 100 个规范场景
- 覆盖 5 个领域,每个领域 20 个场景:
- 银行业 (Banking)
- 医疗保健 (Healthcare)
- 网络安全 (Cybersecurity)
- 能源 (Energy)
- 软件交付 (Software Delivery)
- 每个领域包含针对四个治理视角的场景:
- 权威与政策
- 证据与来源
- 执行与恢复
- 延迟后果、义务与补偿
变体与扩展
- 规范生命周期包生成基础变体、因果姊妹变体和不变性姊妹变体,创建 300 个不可变世界
- 包含伪造和陈旧记录、身份冲突、冲突权限、时间敏感策略变化、长噪声历史、部分影响、重试、崩溃窗口、延迟回读和补偿行动
- 所有外部影响均为模拟且评估者可观察的
评估度量
基准测试将以下三个研究保持分离:
- 直接代理能力:衡量代理在评估者拥有的合成世界中直接行动
- 治理符合性:衡量命名治理构建是否强制执行其声明的生命周期、证据、授权、执行、回读、义务和补偿合同
- 冻结候选者增量影响:重放相同不可变候选者通过直接和治理分支,隔离治理层的影响
报告指标包括:
- 任务正确性
- 后果正确性
- 不安全影响
- 合法影响保留
- 证据基础
- 恢复
- 严重失败
开发排行榜
无 Yuvin 治理层
| 排名 | 模型 | 精确决策 | 正确后果 | 不安全影响 |
|---|---|---|---|---|
| 1 | GPT-5.6 Sol (xhigh) | 60/100 (60%) | 79/100 (79%) | 21 |
| 2 | Gemini 3.6 Flash | 32/100 (32%) | 41/100 (41%) | 59 |
| 3 | Qwen3.6 35B | 23/100 (23%) | 23/100 (23%) | 73 |
| 4 | Gemma4 e4b | 19/100 (19%) | 34/100 (34%) | 63 |
有 Yuvin 治理层
| 排名 | 模型 | 精确决策 | 正确后果 | 不安全影响 |
|---|---|---|---|---|
| 1 | GPT-5.6 Sol (xhigh) | 69/100 (69%) | 99/100 (99%) | 0 |
| 2 | Gemini 3.6 Flash | 58/100 (58%) | 100/100 (100%) | 0 |
| 3 | Gemma4 e4b | 34/100 (34%) | 92/100 (92%) | 0 |
| 4 | Qwen3.6 35B | 32/100 (32%) | 95/100 (95%) | 0 |
所有四个治理运行均记录为零不安全模拟影响。
快速开始
-
环境要求: Python 3.11 或更新版本
-
基本验证命令(无需模型、提供商密钥或网络访问):
consequencebench validate-scenarios consequencebench public-controls consequencebench pressure-controls consequencebench lifecycle-controls consequencebench lifecycle-reference-controls
-
材料化和验证确定性 300 世界生命周期包:
consequencebench lifecycle-materialize-pack --output-dir release/lifecycle-pack consequencebench lifecycle-verify-pack --receipt release/lifecycle-pack/consequencebench-lifecycle-pack.json
评估代理方式
代理通过 JSONL 子进程适配器参与。评估者发送片段,拥有所有工具和源状态,执行预算,记录每次尝试,并通过确定性预言机对结果轨迹评分。
结果报告要求
每个公开结果必须包含:
- ConsequenceBench 版本、源代码提交、轮子哈希和场景清单哈希
- 完整的代理实现和模型配置哈希
- 工具策略、提示、预算、重试、故障、种子和试验清单
- 所有尝试,包括格式错误的输出和超时
- 所选研究轨道的单独官方记分卡
- 硬计数器和置信区间
- 明确的
DEVELOPMENT_ONLY或独立合格的声明标签
重要限制
- 当前为开发预览版,未通过生产安全认证
- 无供应商特定的治理适配器包含在此仓库中
- 产品集成必须在此仓库之外运行,并绑定确切的基准工件、候选者工件和治理系统构建
资源链接
许可证
代码和文档采用 MIT 许可证。




