遇见数据集

IndoRad-VQA

收藏
arXiv2026-06-02 更新2026-06-04 收录
官方服务:

资源简介:

IndoRad-VQA是由布劳维贾亚大学智能系统实验室创建的印尼语放射学视觉问答基准数据集,旨在评估医学视觉语言模型在非英语临床语境下的语言鲁棒性。该数据集包含2248个问答对,覆盖315张医学影像,数据来源于VQA-RAD英文基准的机器翻译版本,通过自评估质量控制流程确保医学术语一致性和语义等效性。其创建过程采用TranslateGemma模型进行英印翻译,并结合自动化清洗与双语规范化词典构建。该数据集主要应用于医学多模态基础模型的多语言评估领域,旨在揭示模型在语言转换下的性能退化问题,推动包容性临床人工智能系统的发展。

IndoRad-VQA is an Indonesian-language radiology visual question answering (VQA) benchmark dataset developed by the Intelligent Systems Laboratory of Brawijaya University, designed to evaluate the linguistic robustness of medical vision-language models in non-English clinical settings. This dataset comprises 2,248 question-answer pairs spanning 315 medical images, with its data derived from machine-translated versions of the English VQA-RAD benchmark. A self-assessed quality control workflow was implemented to guarantee consistency of medical terminology and semantic equivalence across the dataset. The development process utilized the TranslateGemma model for English-to-Indonesian translation, alongside automated data cleaning and the construction of a bilingual standardized lexicon. This dataset is primarily applied in the domain of multilingual evaluation for medical multimodal foundation models, with the objectives of revealing model performance degradation under language transfer and promoting the development of inclusive clinical artificial intelligence systems.

创建时间:
2026-06-02
原始信息汇总

数据集概要

Japanese Medical VQA 12M 是一个大规模、日英双语的医学多模态数据集,基于 Open-PMC-18M 构建,以 Parquet 和 Webdataset 格式发布。

数据集规模与语言

  • 样本总数:12,125,556 条(仅含商业可用样本)
  • 语言:日语(ja)和英语(en
  • 许可证:cc-by-sa-4.0

数据列结构

每条样本包含以下字段:

字段 说明
id 样本标识符
image 图像数据
original_caption 原始语言中的原始标题
original_caption_ja 原始标题的日语翻译
enriched_caption 原始语言中的增强标题
enriched_caption_ja 增强标题的日语翻译
question 生成的问题或指令
answer 生成的目标答案

数据构建流程

  1. 从 Open-PMC-18M 出发
  2. 移除非商业可用数据
  3. 生成增强标题
  4. 生成 VQA 形式的监督信号
  5. 移除生成失败的样本

各阶段使用的模型

步骤 输入 输出 模型/方法
标题增强 图像 + 原始标题 增强标题 InternVL3.5 38B
标题翻译 原始或增强标题 日语标题 Qwen3-30B-A3B
VQA 生成 原始和增强标题 问答对 GPT-oss 120B

样本数量变化

步骤 处理前 处理后 丢弃量
原始 Open-PMC-18M 17,867,999 17,867,999 0
商业可用性过滤 17,867,999 12,125,556 5,742,443

缺失值说明

在多阶段自动构建过程中,部分字段可能出现生成失败,以空字符串 "" 表示:

字段 缺失/为空样本数
original_caption_ja 2,674
enriched_caption 0
enriched_caption_ja 2,909
question 1,668
answer 1,668

文件组织格式

. ├── README.md ├── parquet/ | ├── train-00000-of-XXXXX.parquet | └── ... └── webdataset/ ├── dataset_part_XXXXX.tar └── ...

数据加载方式

  • 通过 huggingface_hub.snapshot_download 分别下载 Parquet 或 Webdataset 格式的完整数据集(详见 README 中的代码示例)。

引用与维护

  • 详细构建、预处理与生成过程请参考论文
  • 联系邮箱:ando [at] mi.t.u-tokyo.ac.jp
搜集汇总
数据集介绍
IndoRad-VQA 数据集图片
构建方式
IndoRad-VQA 的构建基于经典型医学视觉问答数据集 VQA-RAD,包含 2,248 对问答和 315 张医学图像,覆盖头部 CT/MRI、胸部 X 光及腹部 CT 三种模态。研究团队首先采用开源模型 TranslateGemma-4B-it 将英文问答对逐条翻译为印尼语,并提示模型尽量保留医学术语。随后进行自动化清洗,包括小写化、空白标准化,并对二元组(如 yes/ya、no/tidak、right/kanan、left/kiri)进行显式映射。为确保临床语义、术语一致性和答案等价性,翻译过程引入了基于自评估的质量控制机制。最终数据集包含图像编号、英文问题、印尼语答案、答案类型、问题类型及划分标签等关键字段。
使用方法
使用 IndoRad-VQA 时,研究者可采用标准零样本提示评估框架:在英语原始设置下,模型接收 VQA-RAD 的英文问题与对应医学图像;在印尼语翻译设置下,模型接收语义等价的印尼语问题及相同图像,所有指令以印尼语呈现。评估涵盖严格准确率、归一化准确率、Tokenized F1 及基于多语言 BERT 的 BERT-Score 五种互补指标。通过计算 LRG,可量化语言转换带来的性能衰减。该数据集特别适合用于评估通用型、东南亚多语言型及医学专用型视觉语言模型在非英语临床语言环境下的鲁棒性,无需进行微调即可直接进行双语对比实验。
背景与挑战
背景概述
在医学视觉语言模型(VLM)的评估体系中,放射学视觉问答(VQA)作为一项关键任务,长期依赖于英语基准测试,例如VQA-RAD和SLAKE。然而,全球绝大多数人口在临床环境中使用非英语语言,这导致了模型评估的语言盲区,尤其是对于印度尼西亚这样拥有超过2.7亿使用者的语言环境。为填补这一空白,印尼布拉维贾亚大学的研究团队于2026年创建了IndoRad-VQA数据集。该数据集基于VQA-RAD,通过自评估质量控制流水线将2248对放射学问答对翻译为印尼语,旨在系统探究语言迁移是否影响VLM的临床推理能力。其核心研究问题是:在英语放射学VQA上表现优异的模型,当问题以印尼语提出时,能否保持视觉推理能力?该数据集不仅为多语言医学VLM评估提供了首个印尼语基准,也揭示了语言鲁棒性在医学多模态基础模型中的缺失,对推动包容性临床人工智能评估具有里程碑意义。
当前挑战
IndoRad-VQA面临的核心挑战源于语言迁移引发的领域问题:当前医学VLM普遍存在英语中心主义偏差,当临床问题从英语转换为印尼语时,模型的放射学推理能力显著下降。评估发现,严格准确率存在8%至25%的性能差距,即便使用语义相似度指标,语言鲁棒性缺口仍极为明显。具体挑战包括:1)领域问题层面,模型对印尼语封闭式问题(如是非题)容易出现“是非翻转”错误,对侧向性术语(左右)、解剖学词汇的跨语言映射失败,甚至出现输出语言错位(印尼语提示下输出英文回答)。2)构建过程中,翻译流程依赖机器翻译模型TranslateGemma-4B,虽然设置了自评估质量控制,但单一翻译模型在医学术语准确性、语境保真度上存在局限;此外,数据规模有限,仅基于单源数据集VQA-RAD,缺乏多模态、多部位的全面覆盖,且未经过放射科医师的正式临床评审,限制了其临床部署的参考价值。
常用场景
经典使用场景
在医学视觉语言模型的研究中,多语言鲁棒性评估长期缺位,尤其是针对非英语临床语境的系统性测评。IndoRad-VQA的提出,为填补这一空白提供了重要的基准测试工具。该数据集最经典的使用场景在于评估模型在印度尼西亚语临床提问下保留放射学推理能力的情形。通过将VQA-RAD的标准英语问答对精准转化为印度尼西亚语,并引入自评估质量控制以维护医学术语的一致性与答案等价性,研究者在固定医学影像的前提下,能够隔离语言转换带来的推理失效与视觉推理失效。这使得IndoRad-VQA成为检验通用型、东南亚多语言型及医学专用型视觉语言模型在语言偏移下性能稳定性的首选平台。
解决学术问题
该数据集系统性地揭示了医学视觉语言模型在非英语临床环境中的语言鲁棒性缺口,回答了“语言转换是否会破坏模型在放射学问答中的视觉推理能力”这一核心学术问题。研究通过双语评估协议与语言鲁棒性差距指标,量化了从英语到印度尼西亚语切换时所致的8%至25%的性能下降。错误分析进一步细化了失败模式,发现词汇与视觉推理错误占比最高,而肯定/否定翻转、侧别翻转及输出语言不匹配等语言诱导错误也频繁出现。这一发现具有深远意义:它表明即使经过医学专用预训练的模型,也无法自动获得跨语言鲁棒性,从而推动学术界重新审视现有基准的英语中心偏见,并倡导更具包容性的多语言医学人工智能评估范式。
实际应用
在真实世界的临床部署中,印度尼西亚超过2.7亿人口依赖印尼语获取医疗服务,然而此前并无专门的本土语言放射学视觉问答评测体系。IndoRad-VQA的出现,为在印尼医院环境中落地医学影像智能问答系统提供了关键的鲁棒性验证手段。该数据集可用于筛选和优化模型,确保其在语言转换后仍能保持准确的放射学推理,从而减少因语言偏移导致的误诊或漏诊风险。此外,双语标准化词典与错误检测管线的建立,为实际系统中语言适应性调优提供了可操作的参考,例如针对肯定/否定翻转和侧别错误的特殊处理,这有助于提升临床决策支持工具的语言包容性和安全性。
数据集最近研究
最新研究方向
当前,医学视觉语言模型(VLM)在放射学视觉问答任务中展现出卓越性能,然而其评估基准多局限于英语环境,对非英语临床语言的鲁棒性探索尚显不足。针对印尼语这一拥有超过2.7亿使用者的重要临床语言,最新研究引入了IndoRad-VQA数据集,该数据集通过自评估质量控制的翻译流程,将VQA-RAD适配为印尼语版本,旨在严格考察语言转换对模型放射学推理能力的影响。前沿研究聚焦于量化语言鲁棒性差距,通过双语评估协议与错误模式分析(如是非翻转、侧位翻转及输出语言不匹配),揭示了即便在医学专用模型中,英语与印尼语输入间仍存在8%–25%的性能衰退。这一发现凸显了在医疗多模态基础模型评估中纳入多语言维度的紧迫性,为构建更包容、更鲁棒的临床AI系统奠定了关键基准。
相关研究论文
  • 1
    Does Language Shift Break Medical Vision-Language Models? Indonesian Radiology Visual Question Answering Case Study布劳维贾亚大学·智能系统实验室 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务