遇见数据集

ArogyaBodha

收藏
arXiv2026-06-12 更新2026-06-13 收录
官方服务:

资源简介:

ArogyaBodha是由印度理工学院等机构构建的大规模多语言多模态医疗推理数据集,涵盖英语及七种主要印度语言。该数据集包含40,857个样本,整合了八个异构医疗数据源,覆盖31个身体系统和21个临床领域,每个样本均包含专家验证的医疗查询与明确答案。数据集通过GPT-4o-mini和Gemini-2.5-Flash进行少样本提示生成与严格过滤,并采用Gemini-2.5-Pro进行高质量翻译以确保临床语义完整性。该数据集旨在解决低资源印度语言环境下多模态医疗推理的评估瓶颈,推动医疗AI在多元化语言场景中的公平应用。

ArogyaBodha is a large-scale multilingual multimodal medical reasoning dataset developed by institutions including the Indian Institute of Technology and other relevant organizations, supporting English and seven major Indian languages. The dataset comprises 40,857 samples compiled from eight heterogeneous medical data sources, spanning 31 body systems and 21 clinical domains, with each sample containing expert-validated medical queries and definitive, unambiguous answers. The dataset was generated via few-shot prompting and rigorous filtering using GPT-4o-mini and Gemini-2.5-Flash, and underwent high-quality translation with Gemini-2.5-Pro to ensure the integrity of clinical semantics. This dataset aims to address the evaluation bottleneck of multimodal medical reasoning in low-resource Indian language contexts, and promote the equitable application of medical AI across diverse linguistic scenarios.

创建时间:
2026-06-12
原始信息汇总

数据集概述:ArogyaBodha

ArogyaBodha 是一个大规模多语言多模态医学问答数据集,由 ArogyaSutra 项目发布,旨在推动印度语言环境下的多模态医学推理。

核心规模

  • 总样本数:40,857 个经过专家验证的问答样本
  • 数据来源:8 个异构医学来源
  • 覆盖范围:31 个身体系统、6 种成像模态、21 个临床领域
  • 语言:英语及 7 种主要印度语言(阿萨姆语、孟加拉语、印地语、马拉地语、旁遮普语、泰米尔语、泰卢固语)

质量控制

  • 所有样本经过专家验证(Expert Verification)
  • 使用 COMET-QA 进行质量控制

发布信息

  • 该数据集与多智能体框架 ArogyaSutra 及微调模型 arogyasutraV1E3.5(基于 Qwen2.5-VL-7B)一同发布
  • 论文已被 IJCAI 2026 接收
  • 主页:https://iitp-cse.github.io/ArogyaSutra/
  • 模型与数据集获取:🤗 Hugging Face 链接(来源于页面内容中的“🤗 Models & Datasets”按钮,实际地址需参考页面)
搜集汇总
数据集介绍
ArogyaBodha 数据集图片
构建方式
ArogyaBodha数据集通过整合八个异构医学来源构建而成,涵盖MedXpertQA、MedTrinity-25M等公开基准、医学影像库及印度研究生医学入学试题。原始数据经GPT-4o-mini进行少样本提示生成问题,再由Gemini-2.5-Flash基于临床一致性准则(如模态适配性、解剖对齐、发现可见性及临床连贯性)过滤,仅保留具备推理深度且图文相关的样本。随后,采用Gemini-2.5-Pro将筛选后的高质量图文问答对翻译为七种主要印度语言,并由执业医师对临床语义和医学正确性进行人工审核。最终数据集包含英语及七种印度语言,总计40,857个样本,覆盖31个人体系统、六种影像模态和21个临床领域。
特点
该数据集的核心特点在于其大规模、多语言、多模态的医学推理导向设计。每个样本由专家验证的多模态医疗查询与唯一明确的正确答案组成,支持可靠评估逻辑推理精度与语言一致性。数据集覆盖英语及七种印度低资源语言,突破了现有医学推理基准的英语中心局限,使跨语言临床推理分析成为可能。通过融合多样数据源,数据集在人体系统、影像模态和临床领域上实现了广泛覆盖,增强了临床场景的代表性。此外,反向翻译分析(BLEU4分数0.49-0.57,余弦相似度0.93-0.94)和人工评分(平均4.27/5)共同确保了翻译的语义保真度与临床准确性。
使用方法
ArogyaBodha既可作为多语言医学多模态推理的基准测试集,也可用于监督微调与强化学习训练。使用时,模型须对给定医学图像和印度语言查询进行逐步临床推理,最终输出正确的答案。数据集以平衡的语言比例选取每语言130个样本(总计910个)构建测试集,每语言测试集包含来自各数据源的固定数量问题,以支持受控的跨语言对比实验。研究者可直接在Qwen-VL等基座模型上采用有监督微调(SFT)进行训练,或结合ArogyaSutra框架中演员-评论家机制与双重记忆模块,通过蒸馏策略提升推理能力。代码与数据集均公开于项目网站。
背景与挑战
背景概述
在低资源语言与多模态医疗推理交叉领域,现有的大规模多模态语言模型(MLLMs)在通用场景中展现出卓越的推理能力,但在医疗这一专业领域中,尤其是涉及多语言及低资源情境时,其性能显著受限。为弥合这一鸿沟,由印度理工学院巴特那分校(IIT Patna)的Tanmoy Kanti Halder、Akash Ghosh等研究人员于2026年提出了ArogyaBodha数据集。该数据集是一个大规模的多语言多模态医疗问答基准,涵盖了英语及七种主要印度语言(如印地语、孟加拉语等),整合了来自八个异构医疗数据源的5107个样本,横跨31个人体系统、六种成像模态和21个临床领域。ArogyaBodha的诞生为评估与推动面向低资源语言社区的医疗AI推理能力提供了关键资源,对促进医疗公平性和多语言临床决策支持具有深远影响。
当前挑战
ArogyaBodha所面临的挑战多维且深刻。首先,在领域问题层面,其核心任务——多语言多模态医疗推理——要求模型在理解医学影像与印度低资源语言查询的同时,进行逐步的临床逻辑推理,这超出了传统英语中心化MLLMs的直答范式。模型在推理过程中常遭遇逻辑保真度下降和语言行为不稳的双重困境,尤其在跨语言泛化时表现尤甚。其次,在数据集构建过程中,研究人员需从图像报告、考试题目等异质来源中筛选并生成高质量的多模态医疗问答,这要求对32,000余原始样本进行临床一致性、影像模态适配性及解剖对齐的严格过滤。此外,将英文问题精准翻译至七种印度语言并保留临床语义,通过反向翻译与人工医师评估双重校验,以确保语言忠实性和医学准确性,构成了另一项艰巨挑战。
常用场景
经典使用场景
在医疗多模态与多语言推理这一前沿交叉领域中,ArogyaBodha数据集为研究者提供了一座跨越语言鸿沟的桥梁。其经典使用场景聚焦于低资源印度语言环境下的多模态医疗问答任务,涵盖从X光、CT、MRI到病理切片的六种影像模态,覆盖三十一个身体系统与二十一个临床领域。研究者可借助该数据集,在英语与七种主要印度语言上系统训练与评估多模态大语言模型的逐步临床推理能力。尤为重要的是,每一条数据均经过医学专家验证,提供无歧义的正确答案,这使得ArogyaBodha成为检验模型在复杂跨语言临床场景下推理准确性与语言一致性的权威基准。
衍生相关工作
围绕ArogyaBodha数据集,衍生出一系列具有影响力的学术工作。最典型的代表为同一作者团队提出的ArogyaSutra框架,该工作采用演员-评论家多智能体架构,融合工具化视觉定位与双重记忆机制,实现了对多语言医疗推理中逻辑错误与语言不一致的迭代修正。此外,研究者在强化学习路径上探索了MED-R1等方案,通过蒸馏长链推理来提升模型在低资源语言上的鲁棒性。在多智能体协作方向,MMedAgent-RL等方法利用该数据集验证了专家智能体协同在复杂多模态诊断中的优势。这些衍生工作共同构筑了一个致力于可信、包容的多语言医疗AI研究生态,推动了工具感知、记忆辅助与语言自适应推理等技术的融合进化。
数据集最近研究
最新研究方向
ArogyaBodha数据集的最新研究聚焦于多语言、多模态医疗推理的低资源场景,尤其针对印度次大陆的七大主要语言(如印地语、孟加拉语等)与英语的跨语言医疗问答。该数据集通过整合八种异构医疗来源,覆盖31个人体系统、六种成像模态及21个临床领域,构建了大规模、专家验证的多模态问答基准。前沿研究方向包括基于演员-评论家框架的多智能体协作推理,结合视觉工具接地与双记忆机制(短期与长期记忆)实现逐步推理与错误修正,并通过代码切换策略提升低资源语言的推理稳定性。该研究对推动公平医疗AI具有重要意义,解决了英语中心化模型在非英语社区面临的诊断可靠性问题,为临床决策支持系统在语言多样性环境中的部署提供了可验证的技术路径。
相关研究论文
  • 1
    ArogyaSutra: A Multi-Agent Framework for Multimodal Medical Reasoning in Indic Languages印度理工学院巴特那分校; 印度理工学院坎普尔分校; 普拉萨纳德布女子学院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务