Kofi24/adaption-uganda-malaria-clinical-notes
收藏资源简介:
该数据集是一个重新整理的乌干达疟疾临床记录版本,旨在支持低资源、多语言环境下的适应性AI系统开发。数据集捕捉了乌干达真实的临床工作流程,其中医患互动通常使用本地语言,但临床记录必须使用英语。数据集包含合成的临床记录,记录了乌干达各种患者人口统计中的急性发热性疾病,主要是疑似疟疾病例。记录中丰富的英语和乌干达本地语言(如Runyankore、Luganda和Luo)的代码切换,反映了流行地区真实的患者-提供者互动。每个条目包括详细的患者病史、症状进展、临床评估、鉴别诊断和针对特定年龄组和严重程度的治疗计划。数据集涵盖了多种临床场景和年龄组,并支持多种用途,如医学自动语音识别(ASR)、临床推理模型、决策支持系统、临床记录生成和跨语言NLP。
annotations_creators: [] language: - en language_creators: [] license: [] multilinguality: - monolingual pretty_name: 'uganda_malaria_clinical_notes' size_categories: - n<1K source_datasets: - 'extended|https://huggingface.co/datasets/Kofi24/afrihealth-malaria-reasoning' tags: - adaption - instruction-tuning - medical task_categories: [] task_ids: []  本数据集是对[源数据集](https://huggingface.co/datasets/Kofi24/afrihealth-malaria-reasoning)的重制版,通过[Adaption(Adaption Labs)](https://adaptionlabs.ai/app/auth)的适配数据平台制作完成。 ### 数据集概览 本数据集经临床医生指导构建,属于多语言临床推理数据集,旨在助力低资源多语言医疗场景下的适配型人工智能系统研发。 该数据集还原了乌干达地区真实的临床工作流程:医患沟通通常使用本地语言,但临床文档必须以英语撰写。 ### 研发动机 我们通过为期两周的实地调研,访谈了乌干达多个地区的20余名临床医生,以了解其日常工作中面临的困境。 #### 核心发现 1. 乌干达是高度多语言的国家,但存在以下矛盾: - 医患沟通使用本地语言 - 临床笔记必须以英语撰写 2. 语言障碍往往需要人工翻译,由此引发一系列问题: - 沟通延迟 - 临床细节丢失 - 潜在的解读偏差 3. 临床医生提出了对以下人工智能系统的需求: - 即便诊疗过程使用本地语言,也能自动生成英语临床笔记 - 提供诊断建议 - 推荐验证性检查项目 - 拟定治疗方案 ### 适配数据框架 我们设计了多语言结构化数据集,可实现以下功能: - 跨语言理解(本地语言→英语) - 临床推理 - 决策支持 - 文档自动化生成 ### 数据集详情 本数据集包含合成临床笔记,记录了乌干达地区不同人口学特征患者的急性发热性疾病(以疑似疟疾病例为主)。笔记中大量使用英语与乌干达本地语言(如鲁扬科勒语、卢干达语、卢奥语)的语码转换,以反映疟疾流行地区真实的医患交互场景。每条数据均包含详细的患者病史、症状进展、临床评估、鉴别诊断以及针对特定年龄组与严重程度的个性化治疗方案。 #### 覆盖主要语言 - 卢干达语(Luganda) - 阿乔利语(Acholi) - 卢巴拉语(Lugbara) - 鲁扬科勒语(Runyankore) - 斯瓦希里语(Swahili) - 乌干达英语(Ugandan English) - 通过Adaption平台扩展至18种以上其他语言 #### 临床场景 本数据集涵盖了大多数非洲医疗机构常见的5种门诊病症: - 疟疾 - 肺炎(开发中) - 腹泻(开发中) - 普通感冒(开发中) - 营养不良(开发中) #### 年龄分组 所有病例按以下年龄组分层: - 0~5岁 - 6~13岁 - 14~17岁 - 18~35岁 - 36~55岁 #### 非洲医疗机构场景 - 乡村医疗机构(开发中) - 城市医院 ### 数据流水线 每条样本遵循三阶段临床流水线: 1. 会话环节 - 多语言(本地语言+英语语码转换) - 模拟真实门诊(Outpatient Department, OPD)交互场景 - 设计兼容以下应用: - 文本转语音(Text-to-Speech, TTS) - 语音克隆 - 自动语音识别(Automatic Speech Recognition, ASR)训练 2. 结构化临床推理 - 提取症状 - 风险因素 - 鉴别诊断 - 临床解读 3. 临床笔记(英语版) - 最终标准化文档 - 符合乌干达医疗行业的实际要求 ### 应用场景 本数据集用途广泛,可支持以下场景: 1. 医疗自动语音识别(Automatic Speech Recognition, ASR)合成音频生成 - 基于非洲多语言语音模式训练模型 2. 临床推理模型 - 基于会话内容预测诊断结果 3. 决策支持系统 - 提供以下建议: - 诊断建议 - 检查建议 - 治疗方案建议 4. 临床笔记生成 - 将会话内容转换为结构化英语临床笔记 5. 跨语言自然语言处理(Natural Language Processing, NLP) - 将本地语言映射为标准化医学英语 ### 数据集规模 本数据集共包含80条数据,属于指令微调(instruction-tuning)数据集。 ### 重制版数据集质量 最终质量评级为A,相对质量提升幅度为10.0%。 ### 领域 - 医疗(100%) ### 语言 - 英语(100%) ### 语气风格 - 专业(77%) - 技术(23%) ### 评估结果 - **质量提升情况:** <img src="https://proteus-prod-public.s3.us-east-1.amazonaws.com/temp/46fa29ff-a614-4835-8e4f-9dedb0253961.png" alt="QualityGains" style="max-width: 50%; display: block; margin-left: auto; margin-right: auto;" /> - **评级提升情况:** <img src="https://proteus-prod-public.s3.us-east-1.amazonaws.com/temp/d9916ecf-96ce-40d3-8497-fb37c392bf60.png" alt="Grade" style="max-width: 50%; display: block; margin-left: auto; margin-right: auto;" /> - **百分位图表:** <img src="https://proteus-prod-public.s3.us-east-1.amazonaws.com/temp/fc43687d-4a32-427e-811d-007209178034.png" alt="Percentile Chart" style="max-width: 50%; display: block; margin-left: auto; margin-right: auto;" />



