遇见数据集

MedFailBench

收藏
arXiv2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

MedFailBench是由屈塔希亚埃梅特法齐尔·多安州立医院临床医生构建的开源基准数据集,旨在系统评估医疗人工智能的安全边界。该数据集包含100个经过临床医生审查的合成病例,每个病例均标注了严重程度等级(1-5级)和安全门类型,覆盖心脏病学、急诊重症监护、内分泌学等十个专科领域。数据集的创建过程基于匿名的临床推理模式,通过设计开放变量的临床提示来测试AI系统在紧急升级、用药安全等关键安全边界的表现。该数据集主要应用于医疗AI安全评估领域,旨在识别和分类AI模型在临床场景中的失败模式,特别是区分流畅但不安全的响应与谨慎的拒绝,从而提升医疗AI系统的安全性和可靠性。

MedFailBench is an open-source benchmark dataset constructed by clinicians from Kütahya Mehmet Faik Doğan State Hospital, designed to systematically evaluate the safety boundaries of medical artificial intelligence (AI). The dataset contains 100 clinician-reviewed synthetic clinical cases, each annotated with a severity level (scale 1 to 5) and safety gate type, covering ten clinical specialties including cardiology, emergency and critical care, endocrinology, and others. Developed based on anonymized clinical reasoning patterns, the dataset tests the performance of AI systems on critical safety boundaries such as urgent escalation and medication safety by designing clinical prompts with open variables. Primarily applied in the field of medical AI safety assessment, this dataset aims to identify and categorize failure modes of AI models in clinical scenarios, particularly distinguishing between fluent but unsafe responses and cautious refusals, thereby enhancing the safety and reliability of medical AI systems.

创建时间:
2026-07-17
原始信息汇总

Medical AI Failure Atlas 数据集概述

Medical AI Failure Atlas 是一个由临床医生构建的合成基准测试集,用于医学人工智能安全性评估。

核心目标

  • 测试医学AI系统在处理安全关键性措辞、缺失变量、升级边界和来源支持方面的能力。
  • 用于在模型公开发布或下游使用前,检查其在医学安全性方面的行为模式。

数据集内容

  • v0.2.1 版本:
    • 精选证据集: 44 个经临床医生审查的合成案例,涵盖 21 个领域标签,不含患者数据。
    • 更广泛的资源: 包含 150 行情景库和 70 行提示集(需与 44 例精选集分开引用)。
    • 提示集: 一个包含 v1、hard 30 和 scale 30 提示文件的 70 行提示集。

评估焦点

聚焦于临床医生和安全评审员在模型回答被信任前所需捕捉的失效模式:

  1. 缺失的临床变量
  2. 不安全的升级措辞
  3. 过度自信的协议语言
  4. 薄弱的来源支持
  5. 令人困惑的土耳其医学措辞
  6. 缺乏证据的、听起来像验证、部署、排名或认可的主张

目标用户

  1. 开源模型维护者
  2. 基准测试团队
  3. 临床医生
  4. 医学AI研究者
  5. 土耳其医学AI贡献者

关键资源与位置

  • 主页: https://huggingface.co/spaces/goktugozkanmd/medical-ai-failure-atlas
  • DOI: 10.5281/zenodo.21205535
  • 数据集结构:
    • data/: 合成情景和评分规则文件
    • failure_atlas/public/: 公开的分类法和案例收录材料
    • leaderboard/: 预览报告和 HuggingFace Space 应用
    • rubric/v0.2.0/: 临床医生严重性评分规则和安全门分类法
    • scripts/: 验证器、运行器和报告生成器
    • safetyguard/: 可 pip 安装的安全性评估 CLI
    • sourcecheckup/: 来源支持审查工具
    • tr_medllm_safetybench/: 土耳其医学 LLM 安全包
    • docs/: 文档和规划笔记,包含 EU AI Act 合规定位、临床医生小组及战略研究等详细文档。

使用限制

  • 仅供研究、评估、文档审查和模型开发反馈使用。
  • 禁止用于诊断、治疗建议、临床部署、患者分诊、监管审批、排名、评分认证或任何临床声明。
  • 所有公开场景均为合成数据。

许可与引用

  • 代码: Apache-2.0 许可
  • 非代码数据: CC-BY-4.0 许可
  • 推荐引用格式: 详见项目 CITATION.cff 文件
搜集汇总
数据集介绍
MedFailBench 数据集图片
构建方式
在医疗人工智能领域,现有基准多聚焦于模型的知识检索能力,却难以捕捉措辞、边界、证据支持及临床框架等安全失败模式。MedFailBench数据集通过合成病例构建,由临床医师根据普通内科实践中的匿名化临床推理模式设计。每个病例包含一个刻意保留变量的合成临床提示、医疗AI系统的输出、临床医师撰写的边界失败描述、严重性评分及安全门标签。提示旨在测试特定的安全边界,如紧急程度升级、用药安全、出院安抚、证据支持或协议执行。所有病例均经内科医学博士Goktug Ozkan审查,不使用任何患者记录、真实临床笔记或可识别数据。
特点
MedFailBench数据集的核心创新在于其结构化安全失败分类体系。其严重性评分从1级(措辞问题)到5级(高风险不安全框架)精细划分临床风险,而安全门分类则精准标注模型失败的具体原因,涵盖紧急升级遗漏、远程用药不安全、出院安抚不当、证据伪造、协议执行违规及来源支持缺口等六种类型。当前版本包含100个经临床医师审查的合成病例,覆盖心脏病学、急诊与重症监护、内分泌学等十大学科领域,重点聚焦于虚假安抚与用药安全等高危风险轴。每个病例均带有可审阅的风险注释,并配有实时更新的大模型响应评估流水线。
使用方法
研究者可通过公开的GitHub仓库获取结构化JSON格式的病例文件及评估脚本。使用流程包括:首先选择待评估的临床提示,通过API调用目标模型获取输出;随后利用提供的自动化评分脚本从安全性、准确性、来源透明度、拒绝适当性及临床基础五个维度进行初步评估;最终需由临床医师进行人工审查以确认安全标签。数据集支持社区贡献与协作,通过GitHub Discussions提交病例质疑、安全门改进或措辞审查。自动评估结果可在HuggingFace实时排行榜预览,所有资源均采用Apache-2.0与CC-BY-4.0许可协议。
背景与挑战
背景概述
在大型语言模型(LLM)日益渗透临床决策支持的背景下,传统医学基准如MMLU聚焦于知识检索能力,却难以捕捉措辞陷阱、紧急层级遗漏与临床框架谬误等安全隐患。为此,执业内科学家Goktug Ozkan博士于2026年创建了MedFailBench——一个由临床医师主导构建的开源合成基准与失败图谱,旨在回答一个根本性问题:在医学人工智能安全边界中,究竟是哪一道防护失效了?该数据集以100例经临床审查的合成病例为核心,覆盖心脏病学、急诊危重症等十大专科,并引入五级临床严重性量表和六类安全门分类法(如紧急升级遗漏、不安全远程给药、证据捏造等)。作为独立于机构认证的公共安全审查层,MedFailBench已被纳入土耳其2026-2030人工智能愿景的评估框架,通过Apache-2.0与CC-BY-4.0许可开放,为全球医学人工智能安全边界审查提供了可检验、可扩展的标准化工具,显著提升了领域内对错误模式的可见性与讨论深度。
当前挑战
MedFailBench所应对的核心挑战在于,现有医学人工智能基准无法区分流畅但危险的回答与审慎的拒绝——这一领域问题直指安全性评价的结构性缺失。具体而言,模型可能在输出中看似合理却遗漏紧急转诊边界、传递不安全用药建议、或基于证据拼凑给出误导性诊断框架,而这些错误往往被准确率指标所掩盖。在数据集构建过程中,挑战同样严峻:每条合成病例需由临床医师精心设计开放变量(如缺失的生命体征或实验室结果),以安全边界的破坏而非知识问答为测试焦点,这要求案例在临床逼真度与可审查性间取得精妙平衡。此外,严重性标注的客观性高度依赖单一审查者的临床判断,而社区审查工作流(GitHub Discussions)的可靠性及自动化评分系统与临床金标准的一致性验证,仍是当前版本尚未完全攻克的堡垒。这些挑战共同指向一个事实:构建安全边界基准不仅需要编码技术边界,更需要临床推理纪律与社区协作机制的持续演进。
常用场景
经典使用场景
在医学人工智能安全评估的广阔疆域中,MedFailBench开辟了一个聚焦于安全边界失效模式的评测新范式。其最经典的使用场景,是作为一张结构化的失效图谱,用以系统性地检验大型语言模型在临床环境中回答的安全性,而非仅关注其知识准确度。研究者借助其精心设计的合成临床提示和六类安全门标签(如遗漏紧急升级、不安全的远程给药、证据捏造等),能够像病理学家检视切片一般,对模型输出的每个细微失效点进行精确归因与严重性分级,从而完成从模型“知道什么”到模型“何时、如何、以多高风险犯错”的认知跃迁。
实际应用
在实际临床落地层面,MedFailBench展现出作为公共安全审查层的独特价值。它可为医院部署AI辅助诊断系统前提供独立的进场安全筛查,帮助医疗决策支持供应商在产品迭代中定位并修复诸如“不安全的出院安抚”或“遗漏的关键生命体征”等致命边界错误。此外,该系统与土耳其2030国家AI愿景中的健康AI合规框架深度契合,可作为国家大型语言模型Bilge的透明化安全测试面板。开发者社区亦可利用其精心编排的合成病例库和自动化评价流水线,通过每周更新与同行评议,持续监控和提升AI在真实临床工作流中的安全性边界。
衍生相关工作
作为开源安全评估的奠基性资源,MedFailBench已催生出一系列极具衍生价值的研究方向。围绕其核心设计的合成病例构造方法论、严重性评分量表和失效门分类法,已为后续工作提供了可借鉴的标尺。后续研究可能将其核心理念扩展到多语言医疗场景,或与MedHELM等综合评价框架融合,构建覆盖准确性、校准度、公平性与安全性的多维度评测体系。此外,自动化规则评分系统与临床医生判断的一致性验证工作,正在推动建立可解释的AI安全审计标准,而社区驱动的失效模式讨论与标注修订流程,则为构建去中心化的、可持续演进的医学AI安全知识库提供了可复用的集体智慧范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务