官方服务:
资源简介:
<p>外三出院小结病历数据集,可应用在文本分类、命名实体识别、情感分析、知识图谱构建等方面。</p>
应用场景:
创建时间:
2024-01-10
相关数据集
CLIP
CLIP数据集是由麻省理工学院创建,旨在从医院出院记录中提取临床行动项,以帮助医生更有效地共享信息。该数据集包含718份由医生标注的文档,覆盖10万句,用于多方面的提取式总结任务,每个方面代表一种需要采取的行动类型。CLIP数据集的应用领域主要集中在提高患者安全和医生效率,通过自动提取行动项来减少医生在电子健康记录系统中的工作负担。
arXiv2021-06-04 更新790
医疗命名实体识别(NER)任务数据集
数据集文件元信息以及数据文件,请浏览“数据集文件”页面获取。 当前数据集卡片使用的是默认模版,数据集的贡献者未提供更加详细的数据集介绍,但是您可以通过如下GIT Clone命令,或者ModelScope SDK来下载数据集 #### 下载方法 :modelscope-code[]{type="sdk"} :modelscope-code[]{type="git"}
魔搭社区2025-12-17 更新290
physionet-deid-i2b2-2014
Physionet Gold Corpus数据集的标签,用于基于I2B2-2014 de-identification challenge指南的命名实体识别任务,包含记录ID、开始位置、长度和实体类型等信息。
Hugging Face2025-06-23 更新250
CaseReportBench
CaseReportBench 是一个专家注释的数据集,用于从临床病例报告中提取密集信息。该数据集包含 138 个病例报告,重点关注罕见疾病,特别是先天性代谢异常。数据集是从 PMC 开放获取子集(CC BY-NC, CC BY-NC-SA, CC BY-NC-ND)中获取的。数据集的构建过程包括数据预处理、病例报告选择、专家引导注释和数据集协调。数据集旨在评估大型语言模型 (LLM) 在从病例报
arXiv2025-05-23 更新740
liliya-makhmutova/medical_texts_simplification
该数据集名为Medical texts simplification,主要用于文本生成任务,涉及医学领域的文本简化。数据集包含30个三元组(约800个句子),每个三元组包括原始文本、人工简化文本和ChatGPT简化文本。原始数据来源于Medical Notes Classification dataset,涵盖了五个临床领域的医学笔记:胃肠病学、神经学、骨科、放射学和泌尿学。数据集的语言为英语,许
Hugging Face2024-03-19 更新280



