Japanese-Medical-VQA-12m
收藏资源简介:
Japanese Medical VQA 12M 是一个大规模日语医学多模态数据集,基于 Open-PMC-18M 构建并以 Parquet 格式发布。该数据集包含多个数据构建阶段的输出,包括原始标题、日语翻译的原始标题、增强标题、日语翻译的增强标题以及问答对。数据集包含 12,125,556 个样本,每个样本包含以下字段:样本标识符(id)、图像(image)、原始标题(original_caption)、日语原始标题(original_caption_ja)、增强标题(enriched_caption)、日语增强标题(enriched_caption_ja)、问题(question)和答案(answer)。数据集适用于图像到文本和问答等任务,特别适合医学领域的视觉语言和多模态研究。数据集中部分字段存在缺失值,生成失败的部分被替换为空字符串。
Japanese Medical VQA 12M is a large-scale Japanese medical multimodal dataset constructed based on Open-PMC-18M and released in Parquet format. This dataset contains outputs from multiple data construction stages, including original captions, original captions translated into Japanese, enriched captions, enriched captions translated into Japanese, and question-answer pairs. The dataset consists of 12,125,556 samples, each containing the following fields: sample identifier (id), image (image), original caption (original_caption), Japanese original caption (original_caption_ja), enriched caption (enriched_caption), Japanese enriched caption (enriched_caption_ja), question (question), and answer (answer). The dataset is applicable to tasks such as image-to-text generation and visual question answering, and is particularly suitable for vision-language and multimodal research in the medical field. Some fields in the dataset have missing values, and failed generation contents are replaced with empty strings.
Japanese Medical VQA 12M 数据集概述
基本信息
- 数据集名称: Japanese Medical VQA 12M
- 语言: 日语、英语
- 许可证: CC BY-SA 4.0
- 标签: 医学、图像-文本、多模态、日语、视觉-语言、字幕生成、视觉问答、推理
- 任务类别: 图像到文本、问答
- 规模类别: 10M < n < 100M
- 数据格式: Parquet
- 样本总数: 12,125,556
数据来源与构建
- 基础数据源: 基于 Open-PMC-18M 构建。
- 构建过程: 包含多个数据构建阶段的输出。
- 数据筛选: 仅包含商业可用的样本,从原始 17,867,999 个样本中移除了 5,742,443 个非商业或排除的样本。
数据结构与内容
数据列说明
每个数据行包含以下列:
id: 样本标识符。image: 图像列。original_caption: 源语言中的原始字幕。original_caption_ja: 原始字幕的日语翻译。enriched_caption: 源语言中的重新字幕化/增强字幕。enriched_caption_ja: 增强字幕的日语翻译。question: 生成的问题或指令。answer: 生成的目标答案。
构建模型与方法
| 步骤 | 输入 | 输出 | 模型/方法 |
|---|---|---|---|
| 字幕增强 | 图像 + 源字幕 | 增强字幕 | InternVL3.5 38B |
| 字幕翻译 | 源/增强字幕 | 日语字幕 | Qwen3-30B-A3B |
| VQA生成 | 源/增强字幕 | 问答对 | GPT-oss 120B |
缺失值统计
在自动数据构建过程中,生成失败的值被替换为空字符串 ("")。各列缺失/空样本数如下:
original_caption_ja: 2,674enriched_caption: 0enriched_caption_ja: 2,909question: 1,668answer: 1,668
数据访问与使用
加载方式
可通过 Hugging Face datasets 库加载:
python
from datasets import load_dataset
dataset = load_dataset(
"MIL-UT/Japanese-Medical-VQA-12m",
"data",
split="train",
streaming=True,
)
文件结构
数据集以 Parquet 格式存储,结构如下:
. ├── README.md └── data/ ├── train-00000-of-XXXXX.parquet ├── train-00001-of-XXXXX.parquet └── ...
维护信息
- 联系邮箱: ando [at] mi.t.u-tokyo.ac.jp




