遇见数据集

Mostafijur/medichat_conversation

收藏
Hugging Face2024-04-29 更新2024-06-12 收录
官方服务:

资源简介:

--- dataset_info: - config_name: medichat_subset1 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1015787 num_examples: 1000 download_size: 624077 dataset_size: 1015787 - config_name: medichat_subset10 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1051942 num_examples: 1000 download_size: 645691 dataset_size: 1051942 - config_name: medichat_subset11 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1046273 num_examples: 1000 download_size: 636060 dataset_size: 1046273 - config_name: medichat_subset12 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1022793 num_examples: 1000 download_size: 624926 dataset_size: 1022793 - config_name: medichat_subset13 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1039604 num_examples: 1000 download_size: 637209 dataset_size: 1039604 - config_name: medichat_subset14 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1044616 num_examples: 1000 download_size: 634965 dataset_size: 1044616 - config_name: medichat_subset15 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1052313 num_examples: 1000 download_size: 644143 dataset_size: 1052313 - config_name: medichat_subset2 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1039404 num_examples: 1000 download_size: 637502 dataset_size: 1039404 - config_name: medichat_subset3 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1046277 num_examples: 1000 download_size: 638220 dataset_size: 1046277 - config_name: medichat_subset4 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1052354 num_examples: 1000 download_size: 643537 dataset_size: 1052354 - config_name: medichat_subset5 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1030956 num_examples: 1000 download_size: 632046 dataset_size: 1030956 - config_name: medichat_subset6 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1039903 num_examples: 1000 download_size: 637050 dataset_size: 1039903 - config_name: medichat_subset7 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1030755 num_examples: 1000 download_size: 631576 dataset_size: 1030755 - config_name: medichat_subset8 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1029749 num_examples: 1000 download_size: 628328 dataset_size: 1029749 - config_name: medichat_subset9 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1038442 num_examples: 1000 download_size: 634206 dataset_size: 1038442 configs: - config_name: medichat_subset1 data_files: - split: train path: medichat_subset1/train-* - config_name: medichat_subset10 data_files: - split: train path: medichat_subset10/train-* - config_name: medichat_subset11 data_files: - split: train path: medichat_subset11/train-* - config_name: medichat_subset12 data_files: - split: train path: medichat_subset12/train-* - config_name: medichat_subset13 data_files: - split: train path: medichat_subset13/train-* - config_name: medichat_subset14 data_files: - split: train path: medichat_subset14/train-* - config_name: medichat_subset15 data_files: - split: train path: medichat_subset15/train-* - config_name: medichat_subset2 data_files: - split: train path: medichat_subset2/train-* - config_name: medichat_subset3 data_files: - split: train path: medichat_subset3/train-* - config_name: medichat_subset4 data_files: - split: train path: medichat_subset4/train-* - config_name: medichat_subset5 data_files: - split: train path: medichat_subset5/train-* - config_name: medichat_subset6 data_files: - split: train path: medichat_subset6/train-* - config_name: medichat_subset7 data_files: - split: train path: medichat_subset7/train-* - config_name: medichat_subset8 data_files: - split: train path: medichat_subset8/train-* - config_name: medichat_subset9 data_files: - split: train path: medichat_subset9/train-* ---

数据集信息: - 配置名称:medichat_subset1 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1015787,样本数量:1000 下载大小:624077,数据集占用大小:1015787 - 配置名称:medichat_subset10 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1051942,样本数量:1000 下载大小:645691,数据集占用大小:1051942 - 配置名称:medichat_subset11 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1046273,样本数量:1000 下载大小:636060,数据集占用大小:1046273 - 配置名称:medichat_subset12 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1022793,样本数量:1000 下载大小:624926,数据集占用大小:1022793 - 配置名称:medichat_subset13 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1039604,样本数量:1000 下载大小:637209,数据集占用大小:1039604 - 配置名称:medichat_subset14 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1044616,样本数量:1000 下载大小:634965,数据集占用大小:1044616 - 配置名称:medichat_subset15 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1052313,样本数量:1000 下载大小:644143,数据集占用大小:1052313 - 配置名称:medichat_subset2 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1039404,样本数量:1000 下载大小:637502,数据集占用大小:1039404 - 配置名称:medichat_subset3 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1046277,样本数量:1000 下载大小:638220,数据集占用大小:1046277 - 配置名称:medichat_subset4 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1052354,样本数量:1000 下载大小:643537,数据集占用大小:1052354 - 配置名称:medichat_subset5 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1030956,样本数量:1000 下载大小:632046,数据集占用大小:1030956 - 配置名称:medichat_subset6 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1039903,样本数量:1000 下载大小:637050,数据集占用大小:1039903 - 配置名称:medichat_subset7 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1030755,样本数量:1000 下载大小:631576,数据集占用大小:1030755 - 配置名称:medichat_subset8 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1029749,样本数量:1000 下载大小:628328,数据集占用大小:1029749 - 配置名称:medichat_subset9 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1038442,样本数量:1000 下载大小:634206,数据集占用大小:1038442 配置项列表: - 配置名称:medichat_subset1,数据文件: - 拆分:训练集(train),路径:medichat_subset1/train-* - 配置名称:medichat_subset10,数据文件: - 拆分:训练集(train),路径:medichat_subset10/train-* - 配置名称:medichat_subset11,数据文件: - 拆分:训练集(train),路径:medichat_subset11/train-* - 配置名称:medichat_subset12,数据文件: - 拆分:训练集(train),路径:medichat_subset12/train-* - 配置名称:medichat_subset13,数据文件: - 拆分:训练集(train),路径:medichat_subset13/train-* - 配置名称:medichat_subset14,数据文件: - 拆分:训练集(train),路径:medichat_subset14/train-* - 配置名称:medichat_subset15,数据文件: - 拆分:训练集(train),路径:medichat_subset15/train-* - 配置名称:medichat_subset2,数据文件: - 拆分:训练集(train),路径:medichat_subset2/train-* - 配置名称:medichat_subset3,数据文件: - 拆分:训练集(train),路径:medichat_subset3/train-* - 配置名称:medichat_subset4,数据文件: - 拆分:训练集(train),路径:medichat_subset4/train-* - 配置名称:medichat_subset5,数据文件: - 拆分:训练集(train),路径:medichat_subset5/train-* - 配置名称:medichat_subset6,数据文件: - 拆分:训练集(train),路径:medichat_subset6/train-* - 配置名称:medichat_subset7,数据文件: - 拆分:训练集(train),路径:medichat_subset7/train-* - 配置名称:medichat_subset8,数据文件: - 拆分:训练集(train),路径:medichat_subset8/train-* - 配置名称:medichat_subset9,数据文件: - 拆分:训练集(train),路径:medichat_subset9/train-*

提供机构:
Mostafijur
原始信息汇总

数据集概述

数据集配置

medichat_subset1

  • 特征:
    • id: 类型为 string
    • conversation: 结构包含
      • input: 类型为 string
      • output: 类型为 string
  • 分割:
    • train: 字节数为 1015787, 样本数为 1000
  • 下载大小: 624077 字节
  • 数据集大小: 1015787 字节

medichat_subset10

  • 特征:
    • id: 类型为 string
    • conversation: 结构包含
      • input: 类型为 string
      • output: 类型为 string
  • 分割:
    • train: 字节数为 1051942, 样本数为 1000
  • 下载大小: 645691 字节
  • 数据集大小: 1051942 字节

medichat_subset11

  • 特征:
    • id: 类型为 string
    • conversation: 结构包含
      • input: 类型为 string
      • output: 类型为 string
  • 分割:
    • train: 字节数为 1046273, 样本数为 1000
  • 下载大小: 636060 字节
  • 数据集大小: 1046273 字节

medichat_subset12

  • 特征:
    • id: 类型为 string
    • conversation: 结构包含
      • input: 类型为 string
      • output: 类型为 string
  • 分割:
    • train: 字节数为 1022793, 样本数为 1000
  • 下载大小: 624926 字节
  • 数据集大小: 1022793 字节

medichat_subset13

  • 特征:
    • id: 类型为 string
    • conversation: 结构包含
      • input: 类型为 string
      • output: 类型为 string
  • 分割:
    • train: 字节数为 1039604, 样本数为 1000
  • 下载大小: 637209 字节
  • 数据集大小: 1039604 字节

medichat_subset14

  • 特征:
    • id: 类型为 string
    • conversation: 结构包含
      • input: 类型为 string
      • output: 类型为 string
  • 分割:
    • train: 字节数为 1044616, 样本数为 1000
  • 下载大小: 634965 字节
  • 数据集大小: 1044616 字节

medichat_subset15

  • 特征:
    • id: 类型为 string
    • conversation: 结构包含
      • input: 类型为 string
      • output: 类型为 string
  • 分割:
    • train: 字节数为 1052313, 样本数为 1000
  • 下载大小: 644143 字节
  • 数据集大小: 1052313 字节

medichat_subset2

  • 特征:
    • id: 类型为 string
    • conversation: 结构包含
      • input: 类型为 string
      • output: 类型为 string
  • 分割:
    • train: 字节数为 1039404, 样本数为 1000
  • 下载大小: 637502 字节
  • 数据集大小: 1039404 字节

medichat_subset3

  • 特征:
    • id: 类型为 string
    • conversation: 结构包含
      • input: 类型为 string
      • output: 类型为 string
  • 分割:
    • train: 字节数为 1046277, 样本数为 1000
  • 下载大小: 638220 字节
  • 数据集大小: 1046277 字节

medichat_subset4

  • 特征:
    • id: 类型为 string
    • conversation: 结构包含
      • input: 类型为 string
      • output: 类型为 string
  • 分割:
    • train: 字节数为 1052354, 样本数为 1000
  • 下载大小: 643537 字节
  • 数据集大小: 1052354 字节

medichat_subset5

  • 特征:
    • id: 类型为 string
    • conversation: 结构包含
      • input: 类型为 string
      • output: 类型为 string
  • 分割:
    • train: 字节数为 1030956, 样本数为 1000
  • 下载大小: 632046 字节
  • 数据集大小: 1030956 字节

medichat_subset6

  • 特征:
    • id: 类型为 string
    • conversation: 结构包含
      • input: 类型为 string
      • output: 类型为 string
  • 分割:
    • train: 字节数为 1039903, 样本数为 1000
  • 下载大小: 637050 字节
  • 数据集大小: 1039903 字节

medichat_subset7

  • 特征:
    • id: 类型为 string
    • conversation: 结构包含
      • input: 类型为 string
      • output: 类型为 string
  • 分割:
    • train: 字节数为 1030755, 样本数为 1000
  • 下载大小: 631576 字节
  • 数据集大小: 1030755 字节

medichat_subset8

  • 特征:
    • id: 类型为 string
    • conversation: 结构包含
      • input: 类型为 string
      • output: 类型为 string
  • 分割:
    • train: 字节数为 1029749, 样本数为 1000
  • 下载大小: 628328 字节
  • 数据集大小: 1029749 字节

medichat_subset9

  • 特征:
    • id: 类型为 string
    • conversation: 结构包含
      • input: 类型为 string
      • output: 类型为 string
  • 分割:
    • train: 字节数为 1038442, 样本数为 1000
  • 下载大小: 634206 字节
  • 数据集大小: 1038442 字节
搜集汇总
数据集介绍
Mostafijur/medichat_conversation 数据集图片
构建方式
在医疗对话智能领域,高质量的医患交互数据是构建可靠对话系统的基石。Mostafijur/medichat_conversation数据集通过系统性地整理医患交流记录,将原始对话转化为结构化的问答对。每个样本包含一个唯一的标识符以及一段完整的对话,对话由用户输入(input)和系统输出(output)两部分构成。数据集被划分为15个独立的子集(medichat_subset1至medichat_subset15),每个子集均包含1000条训练样本,数据规模均衡,便于分块加载与处理。所有子集均采用统一的特征架构,确保数据格式的一致性。
特点
该数据集最为显著的特点在于其精细化的子集划分策略。15个子集各自独立存储,每个子集大小约为1MB,既保持了整体数据的丰富性,又降低了单次加载的内存压力。每个对话样本均以清晰的输入输出结构呈现,直接服务于医疗对话系统的训练需求。数据集中所有样本均经过预处理,去除了冗余信息,保留了医患交互中的核心语义。此外,统一的特征设计使得不同子集之间可以无缝拼接或交叉验证,为模型训练提供了极大的灵活性。
使用方法
使用该数据集时,研究者可以通过HuggingFace Datasets库按需加载单个或多个子集。例如,调用load_dataset函数并指定config_name参数为'medichat_subset1'即可获取第一个子集。每个子集仅包含训练分割(train split),可直接用于模型微调。数据加载后,每条记录中的'conversation'字段包含了'input'和'output'两个键,分别对应对话的提问与回答。这种结构天然适配序列到序列(Seq2Seq)模型的训练范式,也便于转换为指令微调(instruction tuning)所需的格式。
背景与挑战
背景概述
在人工智能与医疗健康的交叉领域,构建高质量、多轮对话数据集对于训练能够理解复杂医学语境并生成准确回应的对话系统至关重要。Mostafijur/medichat_conversation数据集由研究者Mostafijur Rahman于近期创建,旨在为医学对话模型提供结构化的训练资源。该数据集包含15个子集,每个子集收录了1000条医患对话样本,总计15000条对话记录,每条对话由唯一的标识符和包含输入与输出的对话结构组成。其核心研究问题聚焦于如何利用大规模对话数据提升模型在医疗咨询中的语义理解与应答能力,为智能问诊系统的开发奠定了数据基础。该数据集的发布填补了医学领域公开对话语料库的空白,推动了自然语言处理技术在临床辅助决策中的应用研究。
当前挑战
该数据集面临的核心挑战包括:其一,医学领域的专业性与高风险性要求对话系统具备极高的准确性与可靠性,而当前数据集的规模(总计15000条)与覆盖的疾病范围有限,难以充分训练模型应对罕见病或复杂病例的咨询场景。其二,数据构建过程中,对话样本的标注质量与一致性难以保证,因为医学对话涉及大量专业术语、诊断逻辑及用药建议,标注错误可能引入误导性模式。其三,数据集仅包含训练分割,缺乏验证与测试子集,限制了模型泛化性能的客观评估。此外,对话输入与输出均为文本形式,未整合医学知识图谱或结构化临床数据,可能削弱模型对深层医学逻辑的推理能力。
常用场景
经典使用场景
在人工智能赋能医疗对话系统的浪潮中,Mostafijur/medichat_conversation数据集以其精细化的医患对话结构脱颖而出。该数据集包含15个子集,每个子集约1000条训练样本,每条样本由唯一的标识符与一对输入-输出对话组成,天然适配于序列到序列的生成任务。其最经典的使用场景在于训练端到端的医疗对话生成模型,如基于Transformer架构的对话系统,通过模拟真实医患交互的问答逻辑,使模型习得在特定临床语境下生成专业、连贯且富有同理心的回复,从而推动智能问诊、预检分诊等核心医疗场景的自动化进程。
实际应用
在临床实践与公共卫生服务的前沿,该数据集所驱动的模型可被部署于多种实际场景。例如,在基层医疗资源匮乏的地区,基于medichat_conversation训练的对话系统能够充当初级健康顾问,通过采集患者症状描述进行初步病情评估与就医建议;在大型医院中,其可集成至挂号平台,实现智能预检分诊,分流急诊与非急症患者,优化诊疗流程。此外,该数据集还可用于构建术后随访机器人,自动追踪患者康复情况并提醒用药,显著降低医护人员的工作负荷,提升医疗服务的可及性与效率。
衍生相关工作
该数据集的发布催生了一系列富有影响力的衍生工作。在模型层面,研究者基于此数据微调了医疗领域专用的大语言模型,如Med-PaLM与BioBERT的对话变体,验证了大规模预训练模型在医患交互中的迁移学习潜力。在方法论上,涌现出针对医疗对话的强化学习框架,利用该数据集作为奖励建模的种子语料,优化模型在诊断准确性与沟通礼貌性之间的平衡。此外,部分工作将其与电子健康记录融合,构建多模态医疗对话系统,实现了从文本交互到结构化医学知识图谱的桥接,极大地拓展了智能医疗的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务