遇见数据集

SIP-med-LLM/JMedQA

收藏
Hugging Face2026-07-19 更新2026-07-22 收录
官方服务:

资源简介:

JMedQA是一个基于日本厚生劳动省公开的医師国家試験资料构建的日语医学问答基准数据集,旨在评估大语言模型和视觉语言模型在医学领域的性能。数据集包含2018年至2026年的3581个问题,主要形式为多项选择题,少数为数值答案问题。每个问题提供结构化文本数据(如问题文本、选项、答案)和相关图像(PNG格式),并标注了图像依赖程度(如“无依赖”、“文本足够”、“文本不足”等),以支持不同评估设置(如纯文本评估、多模态评估)。数据集还包括元数据(如临床领域、年份、链接问题标志),并经过预处理以确保独立评估。图像路径通过JSON映射,部分图像因未公开而包含通知图像。数据集的统计信息包括问题类型分布、图像依赖分布和年度分布,适用于医学AI研究和模型基准测试。

JMedQA is a Japanese medical question answering benchmark dataset constructed using publicly available materials from the National Physician Licensing Examination released by the Ministry of Health, Labour and Welfare (MHLW) of Japan, designed to evaluate the performance of Large Language Models (LLMs) and Vision-Language Models (VLMs) in the medical domain. This dataset comprises 3581 questions spanning from 2018 to 2026, most of which are multiple-choice questions, with a small portion being numerical answer questions. Each question is paired with structured textual data (including question text, options, and correct answer) and associated PNG-format images, and is annotated with image dependency levels such as "no image dependency", "sufficient text only", and "insufficient text without images" to support diverse evaluation settings like text-only evaluation and multimodal evaluation. The dataset also includes metadata such as clinical domain, question year, and linked question flag, and has been preprocessed to ensure independent model evaluation. Image paths are mapped via JSON files, and some images are replaced with notification images as they are not publicly available. Its statistical summaries cover the distribution of question types, image dependency levels, and annual question distribution, making it suitable for medical AI research and model benchmarking.

提供机构:
SIP-med-LLM
搜集汇总
数据集介绍
SIP-med-LLM/JMedQA 数据集图片
构建方式
JMedQA的构建源于日本厚生劳动省公开的医师国家考试资料。研究团队采用Vertex AI与Codex(GPT-5.5)对历年PDF文档进行问题提取与数据制备,经过文本清洗、元数据标注及质量校验后,最终形成涵盖2018至2026年度共3581道题目的结构化数据集。数据以CSV格式存储,包含问题文本、选项、标准答案及评估元数据,同时整理出1258张与问题关联的裁剪图像文件,以相对路径形式组织在images目录下。
特点
该数据集核心特色在于多维度的图像依赖标注体系,将问题划分为无依赖、文本可答、文本不足、纯图像及图像提问五种类别,支持纯文本、多模态及跨模态对比等评估场景。数据集保留了原始问题与去除图像引用表述的两种文本版本,并提供灵活的评估子集配置方案。此外,通过自动验证与小规模人工复核相结合的方式实施质量控制,确保了数据在结构化字段、图像路径一致性及样本内容上的可靠性。
使用方法
使用者可通过csv.DictReader加载jmedqa.csv文件,借助image_dependency字段筛选所需评估子集。纯文本评估建议选取dependency为none或enough text的问题,使用question字段作为输入;多模态评估则需结合question_raw与image_paths_json中指向的图像文件。对于既有文本又有图像的问题,研究者可在有无视觉输入的条件下分别实验,以量化视觉信息对医学问答性能的增益效果,并建议按image_dependency类别分别报告结果,确保评估的可比较性。
背景与挑战
背景概述
随着大规模语言模型与视觉语言模型在自然语言处理领域的飞速发展,其在专业医学知识问答中的应用潜力日益受到关注。然而,非英语医学领域的标准评测基准仍然匮乏,尤其是针对日语这一使用广泛但研究资源相对稀少的语言。为填补这一空白,由Yamagishi、Kobayashi、Shibaki、Aizawa与Kurohashi等研究者于2026年构建的JMedQA数据集应运而生。该数据集源自日本厚生劳动省公开的医师国家考试资料,涵盖2018至2026年间的3581道题目,不仅包含纯文本多项选择题,还集成了大量考试图像,并细粒度标注了问题对视觉信息的依赖程度。JMedQA的推出为日语医学领域的语言模型与视觉语言模型提供了标准化的评测平台,有望推动相关模型在真实医学场景中的可解释性与实用性研究。
当前挑战
JMedQA所应对的核心挑战在于多维度评测的复杂性与其构建过程的高精度要求。领域层面,当前多数医学QA基准仅支持纯文本评估,而真实的临床考试往往包含图像判读、影像诊断等视觉任务,模型若无法有效融合图文信息,则难以反映实际应用水平。JMedQA通过五种图像依赖程度标注,使得模型在文本与图像输入条件下的表现差异得以量化分析,但如何确保评测设计与真实临床场景的一致性仍是持续挑战。构建过程中,研究者需从数千份PDF中提取结构化数据,涉及OCR识别、自动注解、文本清理与元数据标注等环节,这一流程依赖Vertex AI与Codex等模型辅助,尽管经过小规模人工审核,但原始材料的复杂版式与部分图像非公开的问题仍可能引入噪声与标注错误,为数据质量与后续复用带来隐患。
常用场景
经典使用场景
JMedQA作为源自日本厚生劳动省公开的医师国家考试资料的医学问答基准,其最经典的应用场景在于对大规模语言模型进行纯粹的文本推理能力评估。研究者常利用该数据集中约七成不依赖图像的题目,通过输入标准化的问题文本来衡量模型在临床医学知识掌握、逻辑判断与多选解答方面的表现。此外,该数据集还精心设计了图像依赖标注,支持对视觉-语言模型进行多模态评估,即结合原始问题文本与关联的考试图像,检验模型在解读医学影像、识别病理特征等任务上的综合能力。这种双轨并行的评估范式,使得JMedQA成为衡量和对比不同架构模型在日语医学领域专业水准的理想平台。
衍生相关工作
JMedQA的发布催生了一系列围绕日语医学语言模型评估与优化的衍生研究工作。后续工作基于其分层评估框架,系统性地比较了不同规模与架构的大规模语言模型,如Llama、GPT系列及日本本土开发的LLM在医学问答上的性能差距,并针对其在图像依赖度各异子集上的表现差异进行了细粒度分析。另有研究者利用该数据集进行模型微调,探索了参数高效微调技术与多模态融合策略,旨在提升模型在低资源医疗场景下的适应能力。此外,JMedQA还为对比零样本学习、少样本学习与全监督学习范式在医学领域的应用效力提供了标准化的实验基础,推动了日语医疗AI评估体系向更高层次发展。
数据集最近研究
最新研究方向
JMedQA数据集的最新研究聚焦于利用日本国家医师资格考试官方材料,构建一个融合文本与视觉模态的医学问答基准,旨在系统评估大语言模型与视觉-语言模型在日语医疗领域的推理能力。该研究紧跟多模态AI在专业医疗场景落地的前沿趋势,通过精细的图像依赖度标注(如“足够文本”、“图像问题”等分类),支持从纯文本推理到多模态联合理解的渐进式评测。其发布恰逢全球对医疗AI安全性与可解释性关注升温之际,为跨语言、跨模态的临床知识评估提供了标准化工具,对推动日语医疗AI的鲁棒性验证与视觉信息增益量化具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务