MedCaseReasoning
收藏资源简介:
一个开放获取的基准和管道,用于评估和改进大型语言模型中的临床诊断推理。包含14,489个临床医生撰写的诊断案例,涵盖30多个医学专业。每个案例包含病例提示、诊断推理和最终诊断标签。
An open-access benchmark and pipeline for evaluating and enhancing clinical diagnostic reasoning in large language models (LLMs). It contains 14,489 diagnostic cases authored by clinicians, spanning over 30 medical specialties. Each case consists of a clinical case prompt, diagnostic reasoning process, and a final diagnostic label.
MedCaseReasoning 数据集概述
📌 数据集基本信息
- 名称:MedCaseReasoning
- 类型:临床诊断推理基准数据集
- 状态:开发中(Under Construction)
- 许可证:
- 代码:MIT
- 数据集:CC-BY 4.0
- 模型检查点:参见各模型卡片
- 访问方式:
- GitHub:https://github.com/kevinwu23/MedCaseReasoning
- HuggingFace:https://huggingface.co/datasets/zou-lab/MedCaseReasoning
- 相关论文:https://arxiv.org/abs/2505.11733
📊 数据集统计
- 总病例数:14,489
- 训练集:13,092例(用于监督微调和分析)
- 测试集:897例(用于模型无关评估)
- 覆盖领域:30+个医学专科
🏷️ 数据内容
每个病例包含以下字段:
case_prompt:患者临床表现(在做出鉴别诊断前)diagnostic_reasoning:编号的推理陈述(包含文献引用)final_diagnosis:单一金标准诊断标签
✨ 数据集特点
- 病例提示长度约为典型短病例数据集(如MedQA、MMLU)的2.5倍
- 模拟真实病房记录
🛠️ 工具与脚本
-
数据集加载: python from datasets import load_dataset ds = load_dataset("zou-lab/MedCaseReasoning", "all") # or "train" / "test"
-
评估脚本:
- 支持诊断准确率(1/5/10-shot)和推理召回率评估
-
微调脚本:
- 提供监督微调配方
📜 数据集构建流程
- 批量下载PMC XML
- 识别病例报告PMCID
- 提取匹配XML
- 构建JSONL数据集(包含元数据提取、文本清洗和推理轨迹生成)
📄 引用方式
bibtex @inproceedings{wu2025medcase, title = {MedCaseReasoning: Evaluating and Learning Diagnostic Reasoning from Clinical Case Reports}, author = {Wu, Kevin and Wu, Eric and Thapa, Rahul and others}, booktitle = {NeurIPS}, year = {2025}, url = {https://github.com/kevinwu23/MedCaseReasoning} }




