cds-bench
收藏资源简介:
一个用于评估美国初级保健中AI临床决策支持系统的基准测试数据集,包含27个公开案例和108个未公开案例,涵盖核心临床问答、过时指南检测、临床安全陷阱和多轴幻觉等测试车道。
This benchmark dataset is designed for evaluating AI clinical decision support systems in U.S. primary care. It contains 27 public cases and 108 non-public cases, covering test tracks including core clinical question answering, outdated guideline detection, clinical safety pitfalls, and multi-axis hallucinations.
数据集概述:cds-bench — 家庭医学临床决策支持基准(公开样例)
核心定位: 一个用于评估美国初级保健中AI临床决策支持(CDS)系统的工作基准。本仓库发布了一个代表性的27例公开样本及完整的评分方法;其余108例被保留,从未公开发布,以防止模型针对保留案例的措辞进行训练。
发布状态: 本仓库是一个清理后的公开快照,首次发布于2026年6月。Git历史始于发布之时,而非其描述的2026年2月至6月的工作期间。
基准结构
基准包含四个测试通道(Lane),总计135个案例(27个公开 + 108个保留)。
| 通道 | 总计 | 公开 | 测试内容 |
|---|---|---|---|
golden_60.json |
60 | 12 | 核心临床问答(由评审员根据评分标准打分) |
freshness_30.json |
30 | 6 | 过时指南检测 |
hallucination_30.json |
30 | 6 | 临床安全陷阱(错误前提、危险安抚、漏诊场景) |
halluhard_15.json |
15 | 3 | 多维度幻觉检测(罕见性/基础事实维度) |
公开/保留的拆分基于固定种子(20260614)和每通道约20%的分层分割。
已发布内容
本仓库本身就是发布的公共工件,包含以下核心文件:
index.html— 交互式说明页面(建议首先打开)docs/PUBLIC_CASES.md— 27个公开案例的可读Markdown版本benchmarks/public/— 27个公开案例的JSON格式数据release_clean/— 4个盲审评分标准(rubrics)及评分执行框架LICENSE— 数据采用CC-BY-NC-ND许可,代码采用MIT许可SUBMISSION.md— 评估即服务协议(用于提交模型以获得保留集评分)HIDDEN_MANIFEST.sha256+.meta.json— 108个保留案例的加盐SHA-256哈希及Merkle根;元数据中的salt_commitment将维护者绑定到一个固定的盐值(评分时公开)
存储库布局
- 根目录 —
index.html,LICENSE,SUBMISSION.md,HIDDEN_MANIFEST.sha256+.meta.json benchmarks/public/— 已提交的27个公开案例(按4个通道文件组织)- 保留集 — 108个案例(不在本仓库中,保持私有)
scripts/release/— 构建管道(通道、清单、资产、构建公开版、构建解释器、提交、验证发布)release_clean/— 经过整理的盲审方法工件:评分标准 + 评分执行框架tests/release/— 测试套件(计数、无泄漏、确定性、盲审、门控检查违规)docs/EVOLUTION.md— 基准历史及构建其上的文献docs/PUBLIC_CASES.md— 27个公开案例的可读Markdown版本
保留集评估
108个隐藏案例绝不发布。提交者通过SUBMISSION.md中的评估即服务协议获得保留集评分(维护者运行模型,返回盲审评分卡)。已发布的哈希清单允许任何人验证保留集在发布时是固定的。隐藏集分数和比较器行由维护者证明——清单证明问题集在发布时是固定的,但不证明分数正确。
已知限制
这是一个工作基准,存在已知限制(详见docs/EVOLUTION.md):
- 单一作者策划
- 每通道样本量较小
- 大语言模型作为评判者仅是筛选工具
- 时效性项目会随着时间过时
- 金标准可能重叠模型的训练来源
- 金标准通道是评判参数化的(无固定公开参考答案)
- 安全通道偏向儿科
- 结构化提示可使分数移动约17-20分(基准测量的是系统+提示,而非原始模型)
- 隐藏集和比较器分数由维护者证明





