遇见数据集

bengali-medical-triage-conversations

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

孟加拉语医疗分诊对话数据集(Bengali Medical Triage Conversations)是一个经过医学审核的多轮临床对话数据集,专为在孟加拉语(বাংলা)、Banglish(孟加拉语罗马化拼音)和英语中微调和评估医疗保健AI助手及诊断分诊代理而设计。该数据集主要针对孟加拉国和南亚地区常见的急性热带、感染性和初级保健表现。数据集包含2774个对话,分为训练集(2452个)、验证集(272个)和测试集(50个)。每个对话包含多轮医患交互,助手每轮提出一个相关的鉴别性问题,最终给出三个鉴别诊断的排名评估。数据涵盖10种疾病:疟疾、登革热、基孔肯雅病、伤寒、戊型肝炎、普通感冒/病毒性上呼吸道感染、流感样疾病、尿路感染、社区获得性肺炎、急性腹泻和胃肠炎。数据集包含750多个硬负对比对(如登革热 vs 病毒性发热),以防止诊断过度。字段包括id、language、target_condition、differential_diagnoses、urgency_level、is_contrastive_case、contrast_pair、turns和messages。数据集通过多模型前沿集成合成、过滤和交叉验证,并经过基于规则的自动过滤和临床文献(WHO、CDC、Harrisons Principles of Internal Medicine)的交叉验证。数据集仅供学术研究使用,严禁用于直接临床管理。

Bengali Medical Triage Conversations is a medically reviewed multi-turn clinical dialogue dataset designed for fine-tuning and evaluating healthcare AI assistants and diagnostic triage agents in Bengali (বাংলা), Banglish (Romanized Bengali), and English. The dataset primarily targets acute tropical, infectious, and primary care presentations common in Bangladesh and South Asia. It contains 2774 dialogues, split into training (2452), validation (272), and test (50) sets. Each dialogue includes multiple rounds of doctor-patient interaction, where the assistant asks relevant differential questions and finally provides a ranked assessment of three differential diagnoses. The data covers 10 diseases: malaria, dengue, chikungunya, typhoid, hepatitis E, common cold/viral upper respiratory tract infection, influenza-like illness, urinary tract infection, community-acquired pneumonia, acute diarrhea and gastroenteritis. The dataset includes over 750 hard negative contrast pairs (e.g., dengue vs viral fever) to prevent over-diagnosis. Fields include id, language, target_condition, differential_diagnoses, urgency_level, is_contrastive_case, contrast_pair, turns, and messages. The dataset was synthesized, filtered, and cross-validated through multi-model frontier ensemble methods, and underwent rule-based automated filtering and cross-validation with clinical literature (WHO, CDC, Harrisons Principles of Internal Medicine). The dataset is for academic research only and strictly prohibited for direct clinical management.

创建时间:
2026-08-21
原始信息汇总

孟加拉语医疗分诊对话数据集(Bengali Medical Triage Conversations)

数据集概述

  • 名称:Bengali-Medical-Triage-Conversations
  • 用途:面向医疗保健AI助手与诊断分诊智能体的多轮临床对话数据集,支持模型微调与评估
  • 覆盖语言:孟加拉语(বাংলা)、孟加拉语音译罗马字(Banglish)、英语
  • 地域针对性:孟加拉国及南亚地区常见的急性热带病、传染病及初级医疗场景
  • 许可证:Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NC 4.0)

数据集规模与划分

划分 对话数量 说明
train 2,452 多轮训练对话(10种核心疾病+5组对比对照包)
validation 272 分层验证集
test(基准) 50 经临床整理的评估案例,含金标准目标与危险信号评分标准
总计 2,774 全部经审核、零缺陷对话

数据集特性

  • 多语言脚本路由:根据用户输入语言(孟加拉语、Banglish、英语)自动匹配相应语言的助手回复
  • 临床结构化病史采集:每轮提出1个相关鉴别性问题(共2–4轮),最后输出排名前三的鉴别诊断
  • 硬负样本对比对:包含750余例对比集合(如登革热vs病毒性发热、疟疾vs登革热等),防止过度诊断
  • 零处方安全协议:严格禁止药物处方、任意剂量或未经验证的家庭疗法;自动升级处理急诊危险体征(休克、严重出血、脱水、呼吸窘迫)

覆盖疾病(10种急性热带与感染性疾病)

  1. 疟疾(恶性疟原虫/间日疟原虫)
  2. 登革热(含警示征象/DHF筛查)
  3. 基孔肯雅热
  4. 伤寒(肠沙门菌Typhi血清型)
  5. 戊型肝炎(肠道急性病毒性肝炎)
  6. 普通感冒/病毒性上呼吸道感染
  7. 流感样疾病(ILI)
  8. 尿路感染(急性膀胱炎与肾盂肾炎)
  9. 社区获得性肺炎(CAP)
  10. 急性腹泻与胃肠炎

数据字段(Schema)

  • id(字符串)
  • language(字符串)
  • target_condition(字符串)
  • differential_diagnoses(字符串序列)
  • urgency_level(字符串)
  • is_contrastive_case(布尔值)
  • contrast_pair(字符串)
  • turns(整数)
  • messages(列表:role + content)

数据合成与质控流程

  • 多模型集成生成:GPT 5.6 Sol(临床轨迹生成)、Claude 4.8 Opus(多轮临床推理与脚本路由验证)、Kimi k3(对比边缘案例合成与事实一致性审计)
  • 质量控制
    • 基于规则的自动过滤(强制轮次数量、脚本路由约束、处方药物和任意百分比分数的正则化剔除)
    • 临床文献交叉对照:症状、潜伏期、危险信号和鉴别诊断均依据WHO、CDC及《哈里森内科学原理》标准审核

临床验证依据

  • WHO:疟疾指南(2023)、登革热综合指南(SEARO)、基孔肯雅热临床管理、急性腹泻管理、IMCI肺炎指南
  • CDC:Yellow Book及传染病临床指南
  • 标准医学文献:《哈里森内科学原理》(第21版)、《牛津临床医学手册》(第10版)、NICE临床知识摘要

使用与加载

python from datasets import load_dataset

dataset = load_dataset("Irtisum/bengali-medical-triage-conversations")

伦理与安全声明

该数据集仅供学术研究、医学NLP基准测试及临床对话AI微调使用。并非医疗设备,不提供确定性医学诊断,未经合格医疗人员监督不得用于直接临床管理。

搜集汇总
数据集介绍
bengali-medical-triage-conversations 数据集图片
构建方式
该数据集由多模型前沿集成技术合成,通过GPT-5.6 Sol生成临床轨迹与多样性场景,Claude-4.8 Opus优化多轮推理与脚本路由,Kimi k3细化对比边缘案例并增强孟加拉语-英语代码混合。构建流程涵盖规则过滤、临床文献交叉验证,确保对话结构严谨且符合WHO、CDC等标准。
特点
数据集包含2,774个经医学审计的多轮对话,覆盖10种南亚常见急性热带疾病,特色在于语言路由(孟加拉语、班格利什、英语)与结构化的病史采集,通过硬负面对比对(如登革热与疟疾)强化鉴别诊断能力,并严格遵循零处方安全协议,自动识别危险信号。
使用方法
用户可通过Hugging Face的datasets库直接加载数据集,该库提供训练、验证和测试三个切分,其中测试集为50个临床基准案例。数据集支持微调医疗AI助手,特别适用于多语言临床对话系统,并可结合RAG技术提升诊断准确性,官方还提供了基于此数据集的微调模型Aurora-V3.2供参考使用。
背景与挑战
背景概述
该数据集由Irtisum等研究者于近年来创建,聚焦于孟加拉语、Banglish及英语的多语言临床分诊对话,旨在应对南亚地区高发的热带与感染性疾病。其核心研究问题在于构建一个经医学审计的多轮对话语料库,以支持医疗AI助手的细粒度症状采集与鉴别诊断能力。依托多模型集成生成与严格临床文献交叉验证,数据集覆盖十种关键病种,并嵌入对比性硬负样本对,显著提升了诊断的特异性与安全性。该工作为低资源语言下的临床自然语言处理提供了规模化基准,推动了多语言医疗AI从通用问答向结构化分诊决策的范式演进,对区域公共卫生与大模型落地具有重要示范价值。
当前挑战
领域层面,急性热带传染病症状重叠度高,如登革热与疟疾等易混淆,传统模型在孟加拉语等低资源语言中诊断准确率低下,且缺乏可解释的追问逻辑。构建过程中,需模拟临床真实的多轮追问节奏,同时规避自动生成对话中常见的药物剂量幻觉与逻辑断裂;大规模合成数据还需平衡临床事实一致性、脚本路由的鲁棒性以及对比样本的均衡性,并确保WHO指南与孟加拉本地诊疗习惯的无缝融合,对数据管线的多模态审核与医学审计提出严苛要求。
常用场景
经典使用场景
该数据集作为多语种医疗对话语料库,核心应用场景聚焦于临床分诊对话系统的构建与优化。研究者利用其多轮医患交互结构,训练医疗对话AI模型,使其在孟加拉语、孟加拉式罗马音译(Banglish)及英语混合语境下,能够模拟医生进行症状询问、病史采集与鉴别诊断。数据集中精心设计的2至4轮问诊流程,为模型提供了学习分步式临床推理的范本,尤其适用于开发面向南亚地区基层医疗的智能预检分诊助手,提升资源匮乏环境下疾病筛查的效率与准确性。
解决学术问题
该数据集有效回应了低资源语言医疗自然语言处理研究的核心困境——高质量标注数据匮乏与临床安全校验缺失。它通过覆盖登革热、疟疾、伤寒等十种南亚高发急性传染病,引入超过750例精心构造的硬负样本对比对(如登革热与疟疾的鉴别),为学术社区提供了研究疾病相似表现判别难题的稀缺资源。数据集内嵌的零处方安全协议与危险信号自动升级机制,为医疗AI的安全约束学习设立了新基准,推动了临床对话生成在伦理合规与诊断严谨性方面的理论探索与实证评估。
衍生相关工作
该数据集的发布催生了一系列后续研究与实践工作,其中之一即为官方配套的量化八亿参数模型Aurora-V3.2,该模型通过参数微调(SFT)与检索增强生成(RAG)的融合,在诊断鉴别准确率上实现了从基线不足30%到超过95%的显著跃升,验证了数据质量对模型性能的直接促进。此外,数据集的对比对设计模式与临床审核流程已被后续工作采纳,应用于其他低资源语言(如乌尔都语、印地语)的医疗语料构建,亦启发了针对热带病诊断的对抗性NLP任务开发,推动了医疗对话系统鲁棒性与安全性的评估规范研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务