MedQA-BBY
收藏资源简介:
MedQA-BBY(MedQA-but-better-yield)显著增强了原始MedQA数据集,解决了医学问答系统中的关键限制。该数据集包括两个正确选项、一个负分选项和三个零分选项,并提供了问题分类、语言指标和教育评估标签。这些改进旨在更真实地反映实际医疗实践,超越了之前的单一最佳答案方法。
MedQA-BBY (MedQA-but-better-yield) significantly enhances the original MedQA dataset, addressing key limitations of medical question answering systems. This dataset includes two correct options, one negatively scored option and three zero-score options, and provides question classification, language metrics and educational assessment labels. These improvements aim to more authentically reflect real-world medical practice, going beyond the previous single best answer approach.
MedQA-BBY 数据集概述
数据集改进
MedQA-BBY 数据集在原始 MedQA 数据集的基础上进行了显著改进,主要解决了医疗问答系统中的关键限制问题,具体包括:
- 多正确答案问题:在实际医疗场景中,一个问题往往存在多个正确答案。
- 错误答案的影响:不同错误答案对患者护理的影响程度不同,有些可能对患者造成伤害。
- 开放式问题的评估难度:创建开放式问题进行评估较为困难,即使使用嵌入模型。
关键改进点
-
答案结构细化:
- 两个正确选项
- 一个负面影响选项
- 三个零分选项
-
全面的标签系统:
- 问题分类(解剖系统、医学学科、亚专科)
- 语言学指标(标记长度)
- 教育评估(布鲁姆分类法)
数据集描述
该数据集旨在更准确地反映实际医疗实践,超越了之前单一最佳答案方法的限制。通过这种方式,MedQA-BBY 提供了一个更细致和实用的工具,用于评估和开发医疗领域的 AI 系统。
使用条款
请引用原始 MedQA 论文和即将发表的论文。
数据集构建过程
- 使用 40 个标记实例(开发集)确定最佳的 OpenAI 模型、提示和温度设置。
- 使用 GPT-4 进行初步标记。
- 每个问题由医学毕业生进行审核,添加一个矛盾答案和一个额外正确答案。
- 由另一位医学水平的审核者进行最终检查,确保选项的准确性和一致性。
特别感谢
- 感谢 Jin Di 等人提供的 MedQA 数据集。
- 感谢 Streamlit 团队为开发者提供便利。
- 感谢团队成员为此数据集投入的时间和精力。




