遇见数据集

DocTalkBN

收藏
arXiv2026-08-27 更新2026-08-29 收录
官方服务:

资源简介:

DocTalkBN是一个大规模多模态孟加拉语专家远程医疗对话数据集,由孟加拉国工程技术大学构建。该数据集包含557.63小时的时间对齐音频与文本,涵盖1,515个多轮患者通话与10,274个主持-医生问答对,总计1.7M tokens,覆盖26个医学专科。数据源自全国广播的实时远程医疗节目,经自动字幕、人工验证、去标识化及结构化处理而成。该数据集旨在为低资源语言提供真实临床对话资源,支持医疗分诊分类、建议安全评估、医学命名实体识别等下游任务,推动可靠医疗NLP的发展。

DocTalkBN is a large-scale multimodal Bengali expert telemedicine dialogue dataset constructed by Bangladesh University of Engineering and Technology. It contains 557.63 hours of time-aligned audio and text, covering 1,515 multi-turn patient calls and 10,274 host-doctor question-answering pairs, totaling 1.7 million tokens and spanning 26 medical specialties. The data is sourced from nationwide live broadcast telemedicine programs, and has undergone automatic subtitling, manual verification, de-identification and structured processing. This dataset aims to provide authentic clinical dialogue resources for low-resource languages, supporting downstream tasks such as medical triage classification, safety assessment of recommendations, medical named entity recognition and other related tasks, so as to promote the development of reliable medical natural language processing.

创建时间:
2026-08-27
原始信息汇总

DocTalkBN 数据集详情

数据集概述

DocTalkBN 是一个基于专家真实远程医疗对话的孟加拉语多模态数据集,数据来源于孟加拉语电视频道和 YouTube 频道的健康节目。该数据集涵盖 25 个以上医学专科的真实临床对话,并为四项下游医学 NLP 任务提供了基准测试集。

  • 语言:孟加拉语(Bangla)
  • 领域:医疗保健 / 临床 NLP
  • 平台:Linux

数据来源

DocTalkBN 聚合了来自 14 个主要孟加拉语电视频道的健康节目内容,包括:

频道 节目
BTV স্বাস্থ্য জিজ্ঞাসা
ATN Bangla Sustho Thakun
NTV Shastho Protidin
RTV Sustho Thakun
MyTV My Health
GTV Doctors Chamber
DBC News স্বাস্থ্যকথা
Channel 24 সুরক্ষায় প্রতিদিন, Sustho Merudondo
Jamuna TV Doctors On Call
Maasranga TV Doctors Chamber
Deepto Sustha Jibon
Banglavision Shastha Katha
Boishakhi TV Boishakhi Health
News24 Health Tips

覆盖的医学专科包括心脏病学、神经病学、胃肠病学、儿科、精神病学、骨科、皮肤病学、内分泌学等 17 个以上专科。

数据格式

每个处理后的视频以 JSON 数组存储对话交换记录。每个交换记录包含 type(类型)、timestamp(时间戳)和 turns(说话者轮次列表)。

两种交换类型:

  • host_doctor_qa — 主持人 与医生之间的讨论(一般医学问答)
  • patient_call — 患者电话在线咨询

示例结构:

json [ { "type": "host_doctor_qa", "timestamp": "00:01:15.910", "turns": [ { "speaker": "host", "text": "..." }, { "speaker": "doctor", "text": "..." } ] }, { "type": "patient_call", "timestamp": "00:12:12.389", "turns": [ { "speaker": "patient", "text": "..." }, { "speaker": "doctor", "text": "..." } ] } ]

下游任务

任务 描述 输入 输出
医学命名实体识别(Medical NER) 识别临床文本中的医学实体 文本片段 BIO 标注实体(疾病、药物、症状等)
医学分诊(Medical Triage) 分类患者病例的紧急程度 患者档案(对话历史) 家庭护理 / 就诊 / 急诊
建议安全性(Advice Safety) 检测潜在有害的医学建议 (患者档案,建议)对 安全 / 不安全

数据集构建流程

  1. 视频搜索与元数据收集 — 从 YouTube 搜索并抓取健康节目视频(使用 yt-dlp)
  2. 医疗视频筛选 — 通过 LLM(如 qwen3:30b-instruct)进行医疗保健视频过滤
  3. 元数据提取与转录获取 — 获取 YouTube 自动字幕(SRT)并提取医学标签、专科等派生元数据
  4. 转录解析 — 使用 Gemini 3 Flash Preview 将 SRT 字幕解析为结构化对话
  5. 下游数据集生成 — 分别生成 Medical NER、Triage 和 Advice Safety 数据集
  6. 数据划分 — 组织为 80/10/10 的训练/验证/测试集

支持模型与基线

封闭源 LLM

  • GPT-4O(OpenAI)
  • Gemini 2.5 Flash(Google)
  • Gemini 3 Flash Preview(Google)

开源 LLM

  • Qwen3-32B(32B 参数)
  • Qwen3-30B-Instruct(30B 参数)

BERT 类与嵌入模型

模型 HuggingFace ID 参数量 适用任务
BanglaBERT csebuetnlp/banglabert ~110M NER, Triage
mmBERT jhu-clsp/mmBERT-base ~307M NER, Triage
multilingual-MiniLM sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 紧凑 Triage, Advice Safety
multilingual-E5-small intfloat/multilingual-e5-small 紧凑 Triage, Advice Safety

推理与评估

支持零样本(zero-shot)少样本(few-shot)、**思维链(CoT)微调(finetuned)**四种推理模式,可同时运行多个任务和多个模型进行批量推理。

评估脚本包括:

  • 分诊分类指标(每类 + 宏/微 F1)
  • NER 评估(BIO 格式,seqeval 兼容)
  • 建议安全性指标

未来工作

团队正在开发 建议生成(Advice Generation) 任务,该任务将仅基于患者档案生成自由文本医学建议,并计划采用 LLM-as-a-judge 评估以及自动评估指标(BLEU、token 重叠)。

搜集汇总
数据集介绍
DocTalkBN 数据集图片
构建方式
DocTalkBN数据集的构建基于孟加拉国国家电视台播出的真实远程医疗节目,这些节目由认证医师参与。研究团队首先通过YouTube API检索五年内相关频道的视频,利用Qwen3-30B-Instruct模型基于标题和描述筛选医疗相关视频,并自动分配医学专科标签。随后,获取YouTube自动生成的孟加拉语字幕,经过预处理流程(包括分段、去除广告和非对话内容、规范化转录伪影)后,由五名人工标注员验证转录质量,对不合格的转录进行修订。最后,使用Gemini-3-Flash模型识别说话者、分离轮次,并将对话分类为医患对话或主持人与医生问答,同时利用BNLP工具去除个人身份信息,最终构建出包含557.63小时配对音频和文本的多模态数据集。
特点
DocTalkBN数据集具有显著的多模态与真实性特征。它包含557.63小时的音频与文本配对数据,涵盖1,515次多轮医患通话和10,274次主持人与医生问答,总计170万词元,覆盖26个医学专科。与以往基于医学论坛、书面内容或合成数据构建的资源不同,DocTalkBN保留了真实医学互动中的自发性、上下文丰富性和口语特征,包括模糊表述、症状转移、延迟披露和琐事偏见等临床沟通现象,能够捕捉专家临床医生依赖的隐性线索。此外,数据集还配备了经过人工验证的下游任务标注(如医疗分诊、建议安全性和医学命名实体识别),支持基准测试与临床推理研究。
使用方法
DocTalkBN数据集主要支持三类下游任务的基准测试与研究:医疗分诊分类、医学建议安全性评估和医学命名实体识别。对于医疗分诊,研究人员可利用患者概要(由对话中医生最终建议之前的所有患者陈述构建)作为输入,预测分诊类别(如自我护理、常规门诊、专科转诊或紧急护理)。医学建议安全性评估则要求模型根据患者概要判断单个建议单元是否安全或有害。医学命名实体识别任务需从自然对话中提取七类医学实体(如症状、疾病、药物等)。数据集还支持音频与文本的联合研究,可用于医学语音识别、医学对话生成及低资源语言的临床决策支持系统开发。
背景与挑战
背景概述
DocTalkBN数据集由孟加拉工程技术大学(BUET)的研究团队于2026年创建,旨在填补低资源语言医疗对话数据的空白。该数据集源自全国播出的远程医疗节目,包含557.63小时的双语(孟加拉语)音视频对话,涵盖1,515次医患通话和10,274段主持人与医生的问答,总计170万词元,涉及26个医学专科。与先前基于医疗论坛或合成数据构建的资源不同,DocTalkBN保留了真实临床互动的自发性和语境丰富性,为低资源环境下的医学自然语言处理研究提供了宝贵资源,尤其支持临床推理和医疗对话理解。
当前挑战
DocTalkBN面临的挑战主要有三方面:其一,领域问题层面,医疗分诊分类任务极具挑战性,因为模型需从不完整且口语化的患者病史中进行临床推理,现有最强模型在四分类任务上仅达到宏观F1约0.46,且常混淆常规门诊与转诊决策;其二,构建过程中,从大量视频中筛选医疗相关内容、处理自动字幕的噪声和转录伪影、消除个人身份信息、以及将长转录准确分割为多轮会话均需大量人工验证,团队对36份转录和17份下游标注样本进行了人工修订,过程繁琐且依赖多注释者一致性;其三,孟加拉语的低资源特性加剧了实体识别边界错误和医学词汇过度预测的问题,亟需更鲁棒的标注和评估方法。
常用场景
经典使用场景
DocTalkBN数据集的核心应用场景聚焦于低资源语言环境下的医疗对话理解与多模态临床信息处理。该数据集收录了孟加拉语真实医患对话的音频与文本配对数据,涵盖26个医学专科,其对话结构蕴含丰富的口语特征、上下文跳转和文化隐喻,为研究者提供了宝贵的自然语言资源。经典使用方式包括医疗分诊分类、建议安全性评估以及医学命名实体识别,这些任务要求模型在保持临床推理能力的同时,适应非结构化、自发性的对话模式。鉴于数据集的独特属性,其常被用于训练和评估面向临床对话的语音识别、语义解析及对话管理系统,以推动医疗人工智能在资源匮乏地区的落地应用。
解决学术问题
该数据集解决了低资源语言环境中缺乏真实医患对话数据的关键学术难题,填补了孟加拉语医疗NLP领域空白。现有资源多源自医学论坛、书面健康内容或合成数据,难以捕捉真实临床交互中的自发性、语境丰富性和口语特征。DocTalkBN通过提供大规模、多模态的专家-患者互动记录,使得诸如医疗分诊分类、建议安全评估和医学实体识别等下游任务得以在贴近实际临床场景的条件下开展。其严谨的标注流程与人工验证确保了基准的可靠性,促进了对临床推理模型鲁棒性的深入研究,并为构建安全、文化契合的医疗AI系统奠定了数据基石。
衍生相关工作
该数据集催生了一系列重要的衍生研究与技术路线。围绕其构建的三个下游基准任务,催生了针对低资源语言医疗对话的模型微调策略与评估协议,特别是探索了大型语言模型在零样本与小样本情境下的临床推理边界。后续工作可借鉴其数据采集、清洗与标注管线,设计融合语音特征与文本语义的多模态学习框架,进而推进医学领域语音识别、对话摘要及智能问诊系统的进展。此外,DocTalkBN还激发了对医疗对话中文化因素、隐私保护和安全性评估的方法论探讨,为构建可靠、可信的医疗AI提供了新的研究视角与实践范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务