RefusalBench
收藏资源简介:
RefusalBench是一个模块化、可复现、持续更新的基准测试,用于跟踪前沿LLM在生物研究提示上的拒绝行为,涵盖连续模型世代。它评估了19个前沿模型在141个匹配三元组提示上,这些提示跨越八个蛋白质设计子领域和三个生物风险层级(良性/边界/双重用途),使用一个三法官AI委员会对每个响应在五类合规阶梯上进行分类。v1.0提示集和2026年5月的初始快照(13,389个已裁决行,跨19个模型,v1.1-frozen)已完全提交到此仓库。所有统计分析都可以从提交的数据中重新运行,无需API密钥。
RefusalBench is a modular, reproducible, and continuously updated benchmark designed to track the refusal behaviors of state-of-the-art large language models (LLMs) in response to bio-research prompts across consecutive model generations. It evaluates 19 cutting-edge models against 141 matched triplet prompts spanning eight protein design subfields and three biological risk tiers (benign/marginal/dual-use), with a three-judge AI committee classifying each response across five compliance ladder categories. The v1.0 prompt set and initial May 2026 snapshot (13,389 adjudicated rows across 19 models, v1.1-frozen) have been fully deposited to this repository. All statistical analyses can be replicated using the submitted data without requiring an API key.
RefusalBench 数据集概述
基本介绍
RefusalBench 是一个模块化、可复现、持续更新的基准测试,用于追踪前沿大语言模型在生物研究提示词上的拒绝行为。它评估了 19 个前沿模型在 141 个配对提示词上的表现,覆盖 8 个蛋白质设计子领域和 3 个生物风险等级(良性/边缘/双重用途),使用三人人工智能评审委员会对每个回答进行五个合规等级的分类。
数据集版本与规模
- v1.0 提示词集:141 个冻结的提示词 JSON 文件,涵盖良性(benign)、边缘(borderline)和双重用途(dual_use)三个风险等级
- 2026 年 5 月快照:包含 19 个模型的 13,389 行裁定数据(v1.1-frozen 版本),所有统计分析无需 API 密钥即可从已提交的数据中重新运行
数据内容
提示词设计
- 覆盖 8 个蛋白质设计子领域
- 每个提示词构成匹配三元组
- 按照 C1-C5 资格标准进行正向控制模块的应拒绝标准评估
评估框架
- 三人评审委员会:由 NVIDIA、Cohere、AI21 三家提供评审模型
- 五级合规阶梯:对每个回答进行五个等级的合规性分类
- 16 类别原因分类体系:提供详细的拒绝原因分类
数据文件结构
核心配置目录(benchmark/)
prompts/v1.0/:141 个冻结的提示词 JSON 文件council/v1.1.json:三人评审委员会配置rubric/v1.0.json:五级合规阶梯与 16 类别原因分类体系config/:包含模型路由、定价、管辖权元数据、谱系追踪、采样配置和应拒绝标准(C1-C5)templates/:Jinja/text 模板文件
数据目录(data/)
raw/:原始注释表格(UniProt、BSL 映射、OT JSON)catalogues/:每个子领域的 JSONL 目录文件bundle_definitions.csv:47 行捆绑映射表
结果目录(results/)
snapshots/2026-05/:19 个模型评估 CSV + 裁定数据(13,389 行)pilot/:试点评审委员会输出pretest/:预测试评估 CSVshould_refuse/:应拒绝正向控制公共清单figures/:论文图表生成文件
模型相关信息
- 评估 19 个前沿模型
- 配置文件中包含模型路由、定价和管辖权元数据
- 支持模型谱系追踪,便于跨代纵向比较
数据获取与使用
- 交互式排行榜:可通过 HuggingFace Space 查看无需克隆的 v1.1-frozen 结果
- 数据集链接:可通过 HuggingFace 数据集仓库使用
load_dataset("appliedscientific/refusalbench")加载 - 分析运行:无需 API 密钥即可从提交的
results/snapshots/2026-05/council/adjudicated.csv复现所有结果
相关文档
docs/methodology.md:完整评估方法论(模型、提示词、评估、评审委员会、统计模型、可复现性)docs/data_schemas.md:所有 CSV、JSON 和 JSONL 文件的架构参考docs/catalogue_provenance.md:每个蛋白质的审计追踪(UniProt 验证、BSL 来源)docs/prompt_construction.md:捆绑推导规则和来源文献docs/adapter_decisions.md:提供者和评审者的设计决策记录





