遇见数据集

cds-bench

收藏
github2026-06-15 更新2026-06-17 收录
数据链接:
官方服务:

资源简介:

一个用于评估美国初级保健中AI临床决策支持系统的基准测试数据集,包含27个公开案例和108个未公开案例,涵盖核心临床问答、过时指南检测、临床安全陷阱和多轴幻觉等测试车道。

This benchmark dataset is designed for evaluating AI clinical decision support systems in U.S. primary care. It contains 27 public cases and 108 non-public cases, covering test tracks including core clinical question answering, outdated guideline detection, clinical safety pitfalls, and multi-axis hallucinations.

创建时间:
2026-06-15
原始信息汇总

数据集概述:cds-bench — 家庭医学临床决策支持基准(公开样例)

核心定位: 一个用于评估美国初级保健中AI临床决策支持(CDS)系统的工作基准。本仓库发布了一个代表性的27例公开样本及完整的评分方法;其余108例被保留,从未公开发布,以防止模型针对保留案例的措辞进行训练。

发布状态: 本仓库是一个清理后的公开快照,首次发布于2026年6月。Git历史始于发布之时,而非其描述的2026年2月至6月的工作期间。


基准结构

基准包含四个测试通道(Lane),总计135个案例(27个公开 + 108个保留)。

通道 总计 公开 测试内容
golden_60.json 60 12 核心临床问答(由评审员根据评分标准打分)
freshness_30.json 30 6 过时指南检测
hallucination_30.json 30 6 临床安全陷阱(错误前提、危险安抚、漏诊场景)
halluhard_15.json 15 3 多维度幻觉检测(罕见性/基础事实维度)

公开/保留的拆分基于固定种子(20260614)和每通道约20%的分层分割。


已发布内容

本仓库本身就是发布的公共工件,包含以下核心文件:

  • index.html — 交互式说明页面(建议首先打开)
  • docs/PUBLIC_CASES.md — 27个公开案例的可读Markdown版本
  • benchmarks/public/ — 27个公开案例的JSON格式数据
  • release_clean/ — 4个盲审评分标准(rubrics)及评分执行框架
  • LICENSE — 数据采用CC-BY-NC-ND许可,代码采用MIT许可
  • SUBMISSION.md — 评估即服务协议(用于提交模型以获得保留集评分)
  • HIDDEN_MANIFEST.sha256 + .meta.json — 108个保留案例的加盐SHA-256哈希及Merkle根;元数据中的salt_commitment将维护者绑定到一个固定的盐值(评分时公开)

存储库布局

  • 根目录index.html, LICENSE, SUBMISSION.md, HIDDEN_MANIFEST.sha256 + .meta.json
  • benchmarks/public/ — 已提交的27个公开案例(按4个通道文件组织)
  • 保留集 — 108个案例(不在本仓库中,保持私有)
  • scripts/release/ — 构建管道(通道、清单、资产、构建公开版、构建解释器、提交、验证发布)
  • release_clean/ — 经过整理的盲审方法工件:评分标准 + 评分执行框架
  • tests/release/ — 测试套件(计数、无泄漏、确定性、盲审、门控检查违规)
  • docs/EVOLUTION.md — 基准历史及构建其上的文献
  • docs/PUBLIC_CASES.md — 27个公开案例的可读Markdown版本

保留集评估

108个隐藏案例绝不发布。提交者通过SUBMISSION.md中的评估即服务协议获得保留集评分(维护者运行模型,返回盲审评分卡)。已发布的哈希清单允许任何人验证保留集在发布时是固定的。隐藏集分数和比较器行由维护者证明——清单证明问题集在发布时是固定的,但不证明分数正确。


已知限制

这是一个工作基准,存在已知限制(详见docs/EVOLUTION.md):

  • 单一作者策划
  • 每通道样本量较小
  • 大语言模型作为评判者仅是筛选工具
  • 时效性项目会随着时间过时
  • 金标准可能重叠模型的训练来源
  • 金标准通道是评判参数化的(无固定公开参考答案)
  • 安全通道偏向儿科
  • 结构化提示可使分数移动约17-20分(基准测量的是系统+提示,而非原始模型)
  • 隐藏集和比较器分数由维护者证明
搜集汇总
数据集介绍
cds-bench 数据集图片
构建方式
cds-bench是一个针对美国初级医疗场景的AI临床决策支持系统评估基准。该数据集以分层抽样的方式构建,包含4个测试维度(核心临床QA、过时指南检测、临床安全陷阱、多轴幻觉检测),共计135个案例。其中27个案例作为公开样本发布在GitHub仓库中,剩余108个案例作为隐藏集永不公开。隐藏集通过带盐值的SHA-256哈希和Merkle根进行加密验证,在评分时才会揭示盐值,有效防止模型通过训练数据记忆答案。
特点
该数据集最显著的特征是其独特的防作弊机制——隐藏集采用加密哈希承诺方案,确保评估的公正性。数据集覆盖四大测试通道,其中'幻觉检测'和'临床安全陷阱'通道专门设计了包含错误前提、危险安慰、漏诊场景等复杂临床安全陷阱。每个案例都配备了盲审评分标准,由评审者根据预定规则进行评分,避免固定参考答案带来的局限性。数据集还通过带时间戳的运行日志和完整提交记录构建了可追溯的溯源证明系统。
使用方法
使用者可通过GitHub仓库直接访问27个公开案例的JSON文件和可读Markdown文档,或打开交互式解释器index.html快速了解基准设计。进行隐藏集评估时,需遵循SUBMISSION.md中规定的评估即服务协议,由维护者运行模型并返回盲审评分卡。数据集的构建管道(含通道定义、清单生成、资产打包等)均通过Python脚本实现,便于研究者复现构建过程。公开案例与隐藏集的比例为约20%每通道的固定种子分层划分,确保了评估的统计有效性。
背景与挑战
背景概述
cds-bench基准测试数据集由美国初级医疗领域的研究人员于2026年创建,旨在系统评估人工智能临床决策支持(CDS)系统在真实诊疗场景中的表现。该数据集的核心研究问题聚焦于衡量AI模型在四大关键维度上的能力:核心临床知识问答、陈旧指南检测、临床安全陷阱识别以及多轴幻觉现象规避。通过精心设计的135个测试案例(其中27个公开案例作为代表性样本,108个隐藏案例用于防止模型记忆化训练),该基准为评估CDS系统的临床可靠性提供了标准化框架。作为家庭医学领域首个公开的AI决策支持评估基准,cds-bench填补了临床AI安全性与可信度量化评估的重要空白,对推动AI辅助诊疗技术的负责任应用具有里程碑式的意义。
当前挑战
该数据集面临的挑战主要源自多维度的复杂性。在领域问题层面,临床AI系统普遍存在三大核心挑战:首先,陈旧医学指南的自动检测问题凸显,随时间推移的指南更新与模型训练数据固化之间的矛盾日益尖锐;其次,临床安全陷阱的识别极为困难,模型需要精准甄别虚假前提、危险安抚和漏诊案例等高风险场景;最后,幻觉现象的多轴评估成为关键难题,涉及罕见病识别与知识锚定能力的双重验证。在构建过程中,研究人员需克服数据保密性与验证可信度之间的平衡挑战,通过盐值哈希和Merkle树等技术手段确保隐藏案例的完整性,同时设计弹性的评分机制以适应结构化提示词带来的17-20分评估波动,以及保持金标准与模型训练源之间的独立性。
常用场景
经典使用场景
在家庭医学的临床决策支持(CDS)领域,cds-bench基准被广泛用于评估人工智能系统在初级诊疗环境中的表现。它通过精心设计的27个公开案例与108个隐藏案例,涵盖核心临床问答、过时指南检测、临床安全陷阱及多维度幻觉检测四大测试道,为研究者提供了一套严谨、可复现的评估框架。研究者通常利用该基准对比不同LLM模型在真实临床场景下的辅助决策能力,尤其关注模型对虚假前提、危险安抚、漏诊情景等安全敏感问题的响应,从而量化系统的可靠性边界。
实际应用
在实际应用中,cds-bench可作为医疗AI产品上市前的安全筛查工具。例如,电子病历系统或在线问诊平台可借助该基准测试其内置的CDS模块,检验在面对不同年龄层、典型家庭医学案例时,系统给出的诊断建议是否准确、是否引用了最新指南、是否避免了危险误导。此外,监管机构、医院质量评估部门也可采用该基准作为标准化测试集,对候选的AI决策支持工具进行横向对比,确保进入临床工作流的系统具备最低限度的安全性。
衍生相关工作
cds-bench的出现催生了一系列衍生工作:部分研究者借鉴其四道测试架构,扩展出针对专科医疗(如儿科、老年医学)的专用基准;另一些工作则聚焦于其评估方法论,改进LLM-as-judge的评分协议,以降低评分器自身的偏差。此外,其“隐藏集+哈希验证”的防过拟合设计已被多个新兴临床基准所采纳,成为可信评估的参考范式。围绕该基准的Scoring-as-a-Service模式也推动了多方安全评估生态的形成,使独立机构能够在不泄露测试集的情况下完成模型认证。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务