E3C-Corpus
收藏资源简介:
E3C是一个免费的多语言语料库(英语、法语、意大利语、西班牙语和巴斯克语),包含语义标注的临床叙述,用于语言分析、基准测试和信息提取系统的训练。它包含两种类型的标注:(i) 临床实体(例如,病理),(ii) 时间信息和事实性(例如,事件)。研究人员可以使用我们的语料库的基准训练和测试分割来开发和测试他们自己的模型。
The E3C is a freely available multilingual corpus (including English, French, Italian, Spanish, and Basque) that contains semantically annotated clinical narratives, designed for linguistic analysis, benchmarking, and the training of information extraction systems. It features two types of annotations: (i) clinical entities (e.g., pathologies), and (ii) temporal information and factuality (e.g., events). Researchers can utilize the benchmark training and test splits of our corpus to develop and test their own models.
E3C-Corpus 数据集概述
数据集描述
E3C-Corpus 是一个多语言(英语、法语、意大利语、西班牙语和巴斯克语)的临床叙述语料库,包含语义标注,用于支持信息提取系统的语言分析、基准测试和训练。该数据集包含两种类型的标注:(i) 临床实体(如病理)和 (ii) 时间信息及事实性(如事件)。
数据组织
数据集分为三个层次:
- Layer 1: 约25,000个标记/语言,包含完整的临床实体、时间信息和事实性的手动标注,用于基准测试和语言分析。
- Layer 2: 50,000-100,000个标记/语言,包含临床实体的半自动标注。
- Layer 3: 约1,000,000个标记/语言,包含未标注的医学文档,适用于半监督方法。
数据来源
数据来源于多种渠道,包括PubMed、The Pan African Medical Journal、SPACCC corpus及其他医学相关的出版物和测试。
数据清洗与标注
- Layer 1: 文档经过基本预处理,包括去除非临床案例部分、参考文献,以及恢复标点和大小写。文档包含完整的临床实体、时间信息和事实性的手动标注。
- Layer 2: 临床实体通过字典匹配自动识别,并进行小样本手动校验。
数据验证
Layer 2中约10%的标记进行了手动标注,以评估临床实体的质量。结果显示了不同语言的精确度、召回率和F1分数。
数据使用
E3C-Corpus 支持信息提取系统的训练和评估。Layer 1分为训练和测试集,Layer 2和Layer 3可用于辅助训练。
许可
E3C-Corpus 根据Creative Commons NonCommercial 许可证(CC BY-NC)发布。
注释指南
提供了临床实体、时间信息和事实性标注的指南文档。
机器学习应用
数据集支持机器学习模型的训练和评估,提供了预处理数据格式,便于与多种机器学习库兼容。




