Mostafijur/medichat_conversation
收藏资源简介:
--- dataset_info: - config_name: medichat_subset1 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1015787 num_examples: 1000 download_size: 624077 dataset_size: 1015787 - config_name: medichat_subset10 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1051942 num_examples: 1000 download_size: 645691 dataset_size: 1051942 - config_name: medichat_subset11 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1046273 num_examples: 1000 download_size: 636060 dataset_size: 1046273 - config_name: medichat_subset12 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1022793 num_examples: 1000 download_size: 624926 dataset_size: 1022793 - config_name: medichat_subset13 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1039604 num_examples: 1000 download_size: 637209 dataset_size: 1039604 - config_name: medichat_subset14 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1044616 num_examples: 1000 download_size: 634965 dataset_size: 1044616 - config_name: medichat_subset15 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1052313 num_examples: 1000 download_size: 644143 dataset_size: 1052313 - config_name: medichat_subset2 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1039404 num_examples: 1000 download_size: 637502 dataset_size: 1039404 - config_name: medichat_subset3 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1046277 num_examples: 1000 download_size: 638220 dataset_size: 1046277 - config_name: medichat_subset4 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1052354 num_examples: 1000 download_size: 643537 dataset_size: 1052354 - config_name: medichat_subset5 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1030956 num_examples: 1000 download_size: 632046 dataset_size: 1030956 - config_name: medichat_subset6 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1039903 num_examples: 1000 download_size: 637050 dataset_size: 1039903 - config_name: medichat_subset7 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1030755 num_examples: 1000 download_size: 631576 dataset_size: 1030755 - config_name: medichat_subset8 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1029749 num_examples: 1000 download_size: 628328 dataset_size: 1029749 - config_name: medichat_subset9 features: - name: id dtype: string - name: conversation struct: - name: input dtype: string - name: output dtype: string splits: - name: train num_bytes: 1038442 num_examples: 1000 download_size: 634206 dataset_size: 1038442 configs: - config_name: medichat_subset1 data_files: - split: train path: medichat_subset1/train-* - config_name: medichat_subset10 data_files: - split: train path: medichat_subset10/train-* - config_name: medichat_subset11 data_files: - split: train path: medichat_subset11/train-* - config_name: medichat_subset12 data_files: - split: train path: medichat_subset12/train-* - config_name: medichat_subset13 data_files: - split: train path: medichat_subset13/train-* - config_name: medichat_subset14 data_files: - split: train path: medichat_subset14/train-* - config_name: medichat_subset15 data_files: - split: train path: medichat_subset15/train-* - config_name: medichat_subset2 data_files: - split: train path: medichat_subset2/train-* - config_name: medichat_subset3 data_files: - split: train path: medichat_subset3/train-* - config_name: medichat_subset4 data_files: - split: train path: medichat_subset4/train-* - config_name: medichat_subset5 data_files: - split: train path: medichat_subset5/train-* - config_name: medichat_subset6 data_files: - split: train path: medichat_subset6/train-* - config_name: medichat_subset7 data_files: - split: train path: medichat_subset7/train-* - config_name: medichat_subset8 data_files: - split: train path: medichat_subset8/train-* - config_name: medichat_subset9 data_files: - split: train path: medichat_subset9/train-* ---
数据集信息: - 配置名称:medichat_subset1 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1015787,样本数量:1000 下载大小:624077,数据集占用大小:1015787 - 配置名称:medichat_subset10 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1051942,样本数量:1000 下载大小:645691,数据集占用大小:1051942 - 配置名称:medichat_subset11 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1046273,样本数量:1000 下载大小:636060,数据集占用大小:1046273 - 配置名称:medichat_subset12 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1022793,样本数量:1000 下载大小:624926,数据集占用大小:1022793 - 配置名称:medichat_subset13 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1039604,样本数量:1000 下载大小:637209,数据集占用大小:1039604 - 配置名称:medichat_subset14 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1044616,样本数量:1000 下载大小:634965,数据集占用大小:1044616 - 配置名称:medichat_subset15 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1052313,样本数量:1000 下载大小:644143,数据集占用大小:1052313 - 配置名称:medichat_subset2 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1039404,样本数量:1000 下载大小:637502,数据集占用大小:1039404 - 配置名称:medichat_subset3 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1046277,样本数量:1000 下载大小:638220,数据集占用大小:1046277 - 配置名称:medichat_subset4 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1052354,样本数量:1000 下载大小:643537,数据集占用大小:1052354 - 配置名称:medichat_subset5 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1030956,样本数量:1000 下载大小:632046,数据集占用大小:1030956 - 配置名称:medichat_subset6 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1039903,样本数量:1000 下载大小:637050,数据集占用大小:1039903 - 配置名称:medichat_subset7 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1030755,样本数量:1000 下载大小:631576,数据集占用大小:1030755 - 配置名称:medichat_subset8 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1029749,样本数量:1000 下载大小:628328,数据集占用大小:1029749 - 配置名称:medichat_subset9 特征字段: - 名称:id,数据类型:字符串 - 名称:conversation,结构体类型,包含以下子字段: - 名称:input,数据类型:字符串 - 名称:output,数据类型:字符串 数据拆分: - 拆分名称:训练集(train),字节数:1038442,样本数量:1000 下载大小:634206,数据集占用大小:1038442 配置项列表: - 配置名称:medichat_subset1,数据文件: - 拆分:训练集(train),路径:medichat_subset1/train-* - 配置名称:medichat_subset10,数据文件: - 拆分:训练集(train),路径:medichat_subset10/train-* - 配置名称:medichat_subset11,数据文件: - 拆分:训练集(train),路径:medichat_subset11/train-* - 配置名称:medichat_subset12,数据文件: - 拆分:训练集(train),路径:medichat_subset12/train-* - 配置名称:medichat_subset13,数据文件: - 拆分:训练集(train),路径:medichat_subset13/train-* - 配置名称:medichat_subset14,数据文件: - 拆分:训练集(train),路径:medichat_subset14/train-* - 配置名称:medichat_subset15,数据文件: - 拆分:训练集(train),路径:medichat_subset15/train-* - 配置名称:medichat_subset2,数据文件: - 拆分:训练集(train),路径:medichat_subset2/train-* - 配置名称:medichat_subset3,数据文件: - 拆分:训练集(train),路径:medichat_subset3/train-* - 配置名称:medichat_subset4,数据文件: - 拆分:训练集(train),路径:medichat_subset4/train-* - 配置名称:medichat_subset5,数据文件: - 拆分:训练集(train),路径:medichat_subset5/train-* - 配置名称:medichat_subset6,数据文件: - 拆分:训练集(train),路径:medichat_subset6/train-* - 配置名称:medichat_subset7,数据文件: - 拆分:训练集(train),路径:medichat_subset7/train-* - 配置名称:medichat_subset8,数据文件: - 拆分:训练集(train),路径:medichat_subset8/train-* - 配置名称:medichat_subset9,数据文件: - 拆分:训练集(train),路径:medichat_subset9/train-*
数据集概述
数据集配置
medichat_subset1
- 特征:
id: 类型为stringconversation: 结构包含input: 类型为stringoutput: 类型为string
- 分割:
train: 字节数为1015787, 样本数为1000
- 下载大小:
624077字节 - 数据集大小:
1015787字节
medichat_subset10
- 特征:
id: 类型为stringconversation: 结构包含input: 类型为stringoutput: 类型为string
- 分割:
train: 字节数为1051942, 样本数为1000
- 下载大小:
645691字节 - 数据集大小:
1051942字节
medichat_subset11
- 特征:
id: 类型为stringconversation: 结构包含input: 类型为stringoutput: 类型为string
- 分割:
train: 字节数为1046273, 样本数为1000
- 下载大小:
636060字节 - 数据集大小:
1046273字节
medichat_subset12
- 特征:
id: 类型为stringconversation: 结构包含input: 类型为stringoutput: 类型为string
- 分割:
train: 字节数为1022793, 样本数为1000
- 下载大小:
624926字节 - 数据集大小:
1022793字节
medichat_subset13
- 特征:
id: 类型为stringconversation: 结构包含input: 类型为stringoutput: 类型为string
- 分割:
train: 字节数为1039604, 样本数为1000
- 下载大小:
637209字节 - 数据集大小:
1039604字节
medichat_subset14
- 特征:
id: 类型为stringconversation: 结构包含input: 类型为stringoutput: 类型为string
- 分割:
train: 字节数为1044616, 样本数为1000
- 下载大小:
634965字节 - 数据集大小:
1044616字节
medichat_subset15
- 特征:
id: 类型为stringconversation: 结构包含input: 类型为stringoutput: 类型为string
- 分割:
train: 字节数为1052313, 样本数为1000
- 下载大小:
644143字节 - 数据集大小:
1052313字节
medichat_subset2
- 特征:
id: 类型为stringconversation: 结构包含input: 类型为stringoutput: 类型为string
- 分割:
train: 字节数为1039404, 样本数为1000
- 下载大小:
637502字节 - 数据集大小:
1039404字节
medichat_subset3
- 特征:
id: 类型为stringconversation: 结构包含input: 类型为stringoutput: 类型为string
- 分割:
train: 字节数为1046277, 样本数为1000
- 下载大小:
638220字节 - 数据集大小:
1046277字节
medichat_subset4
- 特征:
id: 类型为stringconversation: 结构包含input: 类型为stringoutput: 类型为string
- 分割:
train: 字节数为1052354, 样本数为1000
- 下载大小:
643537字节 - 数据集大小:
1052354字节
medichat_subset5
- 特征:
id: 类型为stringconversation: 结构包含input: 类型为stringoutput: 类型为string
- 分割:
train: 字节数为1030956, 样本数为1000
- 下载大小:
632046字节 - 数据集大小:
1030956字节
medichat_subset6
- 特征:
id: 类型为stringconversation: 结构包含input: 类型为stringoutput: 类型为string
- 分割:
train: 字节数为1039903, 样本数为1000
- 下载大小:
637050字节 - 数据集大小:
1039903字节
medichat_subset7
- 特征:
id: 类型为stringconversation: 结构包含input: 类型为stringoutput: 类型为string
- 分割:
train: 字节数为1030755, 样本数为1000
- 下载大小:
631576字节 - 数据集大小:
1030755字节
medichat_subset8
- 特征:
id: 类型为stringconversation: 结构包含input: 类型为stringoutput: 类型为string
- 分割:
train: 字节数为1029749, 样本数为1000
- 下载大小:
628328字节 - 数据集大小:
1029749字节
medichat_subset9
- 特征:
id: 类型为stringconversation: 结构包含input: 类型为stringoutput: 类型为string
- 分割:
train: 字节数为1038442, 样本数为1000
- 下载大小:
634206字节 - 数据集大小:
1038442字节




