GlobMed
收藏资源简介:
GlobMed是迄今为止最大的多语言医疗数据集,涵盖20种语言,包含80万+条目。覆盖高资源语言(如阿拉伯语、中文、英语等)和低资源语言(如孟加拉语、马来语等)。核心任务包括自然语言推理、长形式问答和多选题问答等。
GlobMed is the largest multilingual medical dataset to date, covering 20 languages and containing over 800,000 entries. It covers both high-resource languages such as Arabic, Chinese, English, etc. and low-resource languages such as Bengali, Malay, etc. Its core tasks include natural language inference, long-form question answering, multiple-choice question answering, and more.
GlobMed 数据集概述
数据集简介
GlobMed 是目前规模最大的多语言医学数据集,旨在推动全球医学领域大型语言模型的发展。
数据集规模与覆盖范围
- 数据条目:超过 800,000 条。
- 覆盖语言:20 种。
- 高资源语言:阿拉伯语、中文、英语、法语、德语、印地语、印度尼西亚语、日语、韩语、葡萄牙语、俄语、西班牙语、泰语。
- 低资源语言:孟加拉语、马来语、斯瓦希里语、乌尔都语、沃洛夫语、约鲁巴语、祖鲁语。
核心任务
数据集包含以下核心医学任务:
- 自然语言推理:BioNLI, MedNLI。
- 长格式问答:ExpertQA-Bio, ExpertQA-Med, LiveQA。
- 多项选择题问答:HeadQA, MedExpQA, MedQA, MMLU-Pro。
基准测试:GlobMed-Bench
基于 GlobMed 数据集,建立了 GlobMed-Bench,用于系统评估 56 个先进的大型语言模型在多语言医学任务上的表现。
- 评估模型:56 个先进的大型语言模型。
- 实验数量:超过 40,000 次独立实验。
- 生成响应:超过 1.25 亿条。
- 关键发现:
- 专有大型语言模型通常整体表现更强。
- 开源权重模型表现出显著的性能差异,并遵循缩放定律。
- 大型语言模型在不同语言间,尤其是低资源语言上,表现出显著的性能差距。
- 具备推理增强能力的大型语言模型持续优于非推理模型。
- 医学领域的大型语言模型并不总是优于其通用领域对应模型。
衍生模型:GlobMed-LLMs
基于 GlobMed 数据集训练了一系列多语言医学大型语言模型,参数规模从 17 亿到 80 亿不等。
使用方式
加载数据集
可通过 Hugging Face datasets 库加载数据集,例如加载英文的 GlobMed-MMLU-Pro:
python
from datasets import load_dataset
globmed_mmlu_pro = load_dataset("ruiyang-medinfo/GlobMed_MMLU-Pro", "en")
运行评估
评估支持多种方式:
- 商业 API:使用 OpenAI、OpenRouter 或 Azure OpenAI 等。
- 本地模型(vLLM 服务):启动 vLLM 服务器后通过 OpenAI 兼容接口调用。
- 本地离线推理(vLLM):直接使用 vLLM 进行批量离线推理。
查看结果
使用 pretty_print 模块可以表格形式查看不同模型在指定任务和语言上的评估结果。
结果文件格式
- JSONL 中间结果:每行对应一个样本的 JSON 对象,包含请求、响应和元数据。
- JSON 最终结果:用于评分的聚合结果,包含样本 ID、模型答案和真实答案。
联系信息
- Rui Yang: yang.rui@duke-nus.edu.sg
- Weihao Xuan: xuan@ms.k.u-tokyo.ac.jp
引用
如需引用,请使用提供的 BibTeX 格式。
许可证
本项目采用 MIT 许可证。




