IndoRad-VQA
收藏资源简介:
IndoRad-VQA是由布劳维贾亚大学智能系统实验室创建的印尼语放射学视觉问答基准数据集,旨在评估医学视觉语言模型在非英语临床语境下的语言鲁棒性。该数据集包含2248个问答对,覆盖315张医学影像,数据来源于VQA-RAD英文基准的机器翻译版本,通过自评估质量控制流程确保医学术语一致性和语义等效性。其创建过程采用TranslateGemma模型进行英印翻译,并结合自动化清洗与双语规范化词典构建。该数据集主要应用于医学多模态基础模型的多语言评估领域,旨在揭示模型在语言转换下的性能退化问题,推动包容性临床人工智能系统的发展。
IndoRad-VQA is an Indonesian-language radiology visual question answering (VQA) benchmark dataset developed by the Intelligent Systems Laboratory of Brawijaya University, designed to evaluate the linguistic robustness of medical vision-language models in non-English clinical settings. This dataset comprises 2,248 question-answer pairs spanning 315 medical images, with its data derived from machine-translated versions of the English VQA-RAD benchmark. A self-assessed quality control workflow was implemented to guarantee consistency of medical terminology and semantic equivalence across the dataset. The development process utilized the TranslateGemma model for English-to-Indonesian translation, alongside automated data cleaning and the construction of a bilingual standardized lexicon. This dataset is primarily applied in the domain of multilingual evaluation for medical multimodal foundation models, with the objectives of revealing model performance degradation under language transfer and promoting the development of inclusive clinical artificial intelligence systems.
数据集概要
Japanese Medical VQA 12M 是一个大规模、日英双语的医学多模态数据集,基于 Open-PMC-18M 构建,以 Parquet 和 Webdataset 格式发布。
数据集规模与语言
- 样本总数:12,125,556 条(仅含商业可用样本)
- 语言:日语(
ja)和英语(en) - 许可证:cc-by-sa-4.0
数据列结构
每条样本包含以下字段:
| 字段 | 说明 |
|---|---|
id |
样本标识符 |
image |
图像数据 |
original_caption |
原始语言中的原始标题 |
original_caption_ja |
原始标题的日语翻译 |
enriched_caption |
原始语言中的增强标题 |
enriched_caption_ja |
增强标题的日语翻译 |
question |
生成的问题或指令 |
answer |
生成的目标答案 |
数据构建流程
- 从 Open-PMC-18M 出发
- 移除非商业可用数据
- 生成增强标题
- 生成 VQA 形式的监督信号
- 移除生成失败的样本
各阶段使用的模型
| 步骤 | 输入 | 输出 | 模型/方法 |
|---|---|---|---|
| 标题增强 | 图像 + 原始标题 | 增强标题 | InternVL3.5 38B |
| 标题翻译 | 原始或增强标题 | 日语标题 | Qwen3-30B-A3B |
| VQA 生成 | 原始和增强标题 | 问答对 | GPT-oss 120B |
样本数量变化
| 步骤 | 处理前 | 处理后 | 丢弃量 |
|---|---|---|---|
| 原始 Open-PMC-18M | 17,867,999 | 17,867,999 | 0 |
| 商业可用性过滤 | 17,867,999 | 12,125,556 | 5,742,443 |
缺失值说明
在多阶段自动构建过程中,部分字段可能出现生成失败,以空字符串 "" 表示:
| 字段 | 缺失/为空样本数 |
|---|---|
original_caption_ja |
2,674 |
enriched_caption |
0 |
enriched_caption_ja |
2,909 |
question |
1,668 |
answer |
1,668 |
文件组织格式
. ├── README.md ├── parquet/ | ├── train-00000-of-XXXXX.parquet | └── ... └── webdataset/ ├── dataset_part_XXXXX.tar └── ...
数据加载方式
- 通过
huggingface_hub.snapshot_download分别下载 Parquet 或 Webdataset 格式的完整数据集(详见 README 中的代码示例)。
引用与维护
- 详细构建、预处理与生成过程请参考论文。
- 联系邮箱:ando [at] mi.t.u-tokyo.ac.jp

- 1Does Language Shift Break Medical Vision-Language Models? Indonesian Radiology Visual Question Answering Case Study布劳维贾亚大学·智能系统实验室 · 2026年



