HoangHa/MedicalTranscriptions
收藏资源简介:
--- dataset_info: features: - name: 'Unnamed: 0' dtype: int64 - name: description dtype: string - name: medical_specialty dtype: string - name: sample_name dtype: string - name: transcription dtype: string - name: keywords dtype: string splits: - name: train num_bytes: 17075399 num_examples: 4999 download_size: 7734500 dataset_size: 17075399 configs: - config_name: default data_files: - split: train path: data/train-* ---
数据集信息: 特征项: - 名称:未命名列0(Unnamed: 0),数据类型:64位整型(int64) - 名称:描述(description),数据类型:字符串 - 名称:医学专科(medical_specialty),数据类型:字符串 - 名称:样本名称(sample_name),数据类型:字符串 - 名称:转录文本(transcription),数据类型:字符串 - 名称:关键词(keywords),数据类型:字符串 数据划分: - 划分名称:训练集(train),字节大小:17075399,样本总数:4999 下载大小:7734500 字节 数据集总大小:17075399 字节 配置项: - 配置名称:默认配置(default),数据文件: - 数据划分:训练集(train),文件路径:data/train-*
数据集概述
数据特征
- Unnamed: 0: 数据类型为
int64 - description: 数据类型为
string - medical_specialty: 数据类型为
string - sample_name: 数据类型为
string - transcription: 数据类型为
string - keywords: 数据类型为
string
数据分割
- train: 包含 4999 个样本,占用 17075399 字节
数据集大小
- 下载大小: 7734500 字节
- 数据集大小: 17075399 字节
配置
- default: 包含训练数据文件,路径为
data/train-*




