遇见数据集

relevanthint/scnclab2023

收藏
Hugging Face2023-01-19 更新2024-03-04 收录
官方服务:

资源简介:

--- annotations_creators: - expert-generated language: - en language_creators: - machine-generated license: [] multilinguality: - monolingual paperswithcode_id: scnclab2023 pretty_name: Synthetical Clinical Notes - Clab 2023 dataset_info: features: - name: tokens sequence: string - name: ner_tags sequence: class_label: names: '0' : O '1' : B-allergies '2' : I-allergies '3' : B-biomarkers '4' : I-biomarkers '5' : B-cancer_symptoms '6' : I-cancer_symptoms '7' : B-cancer_type '8' : I-cancer_type '9' : B-date '10' : I-date '11' : B-diagnosis '12' : I-diagnosis '13' : B-gender '14' : I-gender '15' : B-imaging_options '16' : I-imaging_options '17' : B-test_result '18' : I-test_result '19' : B-treatment '20' : I-treatment size_categories: - n<1K source_datasets: - original tags: - bio - clinic - cancer task_categories: - token-classification task_ids: - named-entity-recognition --- # Dataset Card for [scnclab2023] ## Table of Contents - [Table of Contents](#table-of-contents) - [Dataset Description](#dataset-description) - [Dataset Summary](#dataset-summary) - [Supported Tasks and Leaderboards](#supported-tasks-and-leaderboards) - [Languages](#languages) - [Dataset Structure](#dataset-structure) - [Data Instances](#data-instances) - [Data Fields](#data-fields) - [Data Splits](#data-splits) - [Dataset Creation](#dataset-creation) - [Curation Rationale](#curation-rationale) - [Source Data](#source-data) - [Annotations](#annotations) - [Personal and Sensitive Information](#personal-and-sensitive-information) - [Considerations for Using the Data](#considerations-for-using-the-data) - [Social Impact of Dataset](#social-impact-of-dataset) - [Discussion of Biases](#discussion-of-biases) - [Other Known Limitations](#other-known-limitations) - [Additional Information](#additional-information) - [Dataset Curators](#dataset-curators) - [Licensing Information](#licensing-information) - [Citation Information](#citation-information) - [Contributions](#contributions) ## Dataset Description - **Homepage:** - **Repository:** - **Paper:** - **Leaderboard:** - **Point of Contact:** relevanthint@gmail.com ### Dataset Summary [More Information Needed] ### Supported Tasks and Leaderboards [More Information Needed] ### Languages [More Information Needed] ## Dataset Structure ### Data Instances [More Information Needed] ### Data Fields [More Information Needed] ### Data Splits [More Information Needed] ## Dataset Creation ### Curation Rationale The Dataset has been created using the GPT-3 API by providing a prompt with some manually created clinical notes. #### Who are the source language producers? [More Information Needed] ### Annotations #### Annotation process The annotation has been done using [Argilla](https://github.com/argilla-io) #### Who are the annotators? The sinthetical clinical notes have been annotated by a group of three biomedical experts ### Personal and Sensitive Information [More Information Needed] ## Considerations for Using the Data ### Social Impact of Dataset Note that this is not a real dataset. ### Discussion of Biases [More Information Needed] ### Other Known Limitations [More Information Needed] ## Additional Information ### Dataset Curators [More Information Needed] ### Licensing Information [More Information Needed] ### Citation Information [More Information Needed] ### Contributions Thanks to [@github-username](https://github.com/<github-username>) for adding this dataset.

annotations_creators: - 专家生成 language: - en language_creators: - 机器生成 license: [] multilinguality: - 单语言 paperswithcode_id: scnclab2023 pretty_name: 合成临床笔记——Clab 2023 dataset_info: features: - name: 词元(Token) sequence: 字符串 - name: 命名实体识别标签 sequence: 类标签: 名称: '0' : O '1' : B-过敏症 '2' : I-过敏症 '3' : B-生物标志物 '4' : I-生物标志物 '5' : B-癌症症状 '6' : I-癌症症状 '7' : B-癌症类型 '8' : I-癌症类型 '9' : B-日期 '10' : I-日期 '11' : B-诊断结果 '12' : I-诊断结果 '13' : B-性别 '14' : I-性别 '15' : B-影像检查选项 '16' : I-影像检查选项 '17' : B-检测结果 '18' : I-检测结果 '19' : B-治疗方案 '20' : I-治疗方案 size_categories: - 样本量小于1000 source_datasets: - 原创数据集 tags: - 生物信息学 - 临床 - 癌症 task_categories: - 词元分类(Token Classification) task_ids: - 命名实体识别(Named Entity Recognition) # 数据集卡片 [scnclab2023] ## 目录 - [目录](#目录) - [数据集描述](#数据集描述) - [数据集概述](#数据集概述) - [支持任务与排行榜](#支持任务与排行榜) - [语言](#语言) - [数据集结构](#数据集结构) - [数据实例](#数据实例) - [数据字段](#数据字段) - [数据划分](#数据划分) - [数据集构建](#数据集构建) - [构建初衷](#构建初衷) - [源数据](#源数据) - [注释](#注释) - [个人与敏感信息](#个人与敏感信息) - [数据集使用注意事项](#数据集使用注意事项) - [数据集的社会影响](#数据集的社会影响) - [偏差讨论](#偏差讨论) - [其他已知局限性](#其他已知局限性) - [附加信息](#附加信息) - [数据集维护者](#数据集维护者) - [许可信息](#许可信息) - [引用信息](#引用信息) - [贡献](#贡献) ## 数据集描述 - **主页:** - **代码仓库:** - **论文:** - **排行榜:** - **联系方式:** relevanthint@gmail.com ### 数据集概述 [更多信息待补充] ### 支持任务与排行榜 [更多信息待补充] ### 语言 [更多信息待补充] ## 数据集结构 ### 数据实例 [更多信息待补充] ### 数据字段 [更多信息待补充] ### 数据划分 [更多信息待补充] ## 数据集构建 ### 构建初衷 本数据集通过GPT-3 API构建,向接口输入包含若干人工撰写的临床笔记的提示词完成生成。 #### 源语言生成者是谁? [更多信息待补充] ### 注释 #### 注释流程 本数据集的注释工作通过[Argilla](https://github.com/argilla-io)工具完成。 #### 注释人员是谁? 本合成临床笔记由三名生物医学专家组成的团队完成注释。 ### 个人与敏感信息 [更多信息待补充] ## 数据集使用注意事项 ### 数据集的社会影响 请注意,本数据集并非真实临床数据集。 ### 偏差讨论 [更多信息待补充] ### 其他已知局限性 [更多信息待补充] ## 附加信息 ### 数据集维护者 [更多信息待补充] ### 许可信息 [更多信息待补充] ### 引用信息 [更多信息待补充] ### 贡献 感谢[@github-username](https://github.com/<github-username>)为本数据集添加至仓库。

提供机构:
relevanthint
原始信息汇总

数据集概述

  • 名称: Synthetical Clinical Notes - Clab 2023
  • ID: scnclab2023
  • 语言: 英语 (en)
  • 语言生成方式: 机器生成
  • 多语言性: 单语种
  • 任务类别: 词元分类
  • 任务ID: 命名实体识别
  • 标签创建者: 专家生成
  • 数据集大小: 小于1000条记录
  • 源数据集: 原始数据
  • 标签: 生物、临床、癌症

数据集结构

数据字段

  • tokens: 字符串序列
  • ner_tags: 标签序列,包含以下类别:
    • O
    • B-allergies
    • I-allergies
    • B-biomarkers
    • I-biomarkers
    • B-cancer_symptoms
    • I-cancer_symptoms
    • B-cancer_type
    • I-cancer_type
    • B-date
    • I-date
    • B-diagnosis
    • I-diagnosis
    • B-gender
    • I-gender
    • B-imaging_options
    • I-imaging_options
    • B-test_result
    • I-test_result
    • B-treatment
    • I-treatment

数据集创建

注释过程

  • 注释工具: Argilla
  • 注释者: 一组三名生物医学专家

数据生成

  • 生成方式: 使用GPT-3 API,通过提供手动创建的临床笔记作为提示

注意事项

  • 数据集真实性: 注意,这不是一个真实的数据集。
搜集汇总
数据集介绍
relevanthint/scnclab2023 数据集图片
构建方式
在临床自然语言处理领域,高质量标注数据的匮乏始终是制约模型性能提升的关键瓶颈。为应对这一挑战,relevanthint/scnclab2023数据集应运而生,其构建过程巧妙融合了生成式人工智能与专家知识。具体而言,研究团队首先利用GPT-3应用程序编程接口,以少量人工撰写的临床笔记为提示模板,批量生成合成临床文本。随后,由三位生物医学领域专家组成的标注团队,借助Argilla标注平台,对这些合成文本进行精细的命名实体标注,涵盖了过敏原、生物标志物、癌症症状、癌症类型、日期、诊断、性别、影像学选项、检测结果及治疗等十余类实体,最终形成了兼具规模与专业性的高质量语料库。
特点
该数据集最显著的特征在于其高度的专业性与领域聚焦性。作为面向临床癌症文本的命名实体识别资源,它精准定义了包括癌症类型、症状、生物标志物及治疗方案在内的20种实体标签,为肿瘤学领域的自然语言处理研究提供了细粒度的标注支持。数据集虽规模较小(样本量不足1000条),但全部由专家手工标注,确保了标注的一致性与准确性。此外,所有文本均通过语言模型合成生成,完全规避了真实患者数据中潜在的隐私泄露风险,使其成为学术研究与模型开发的理想测试基准。
使用方法
该数据集专为令牌分类任务设计,尤其适用于训练和评估临床命名实体识别模型。使用者可直接通过HuggingFace Datasets库加载数据,获取包含原始令牌序列及对应命名实体标签的标准化结构。在模型训练中,建议采用基于Transformer的预训练语言模型(如BioBERT或ClinicalBERT)作为编码器,通过序列标注头完成实体边界与类别的分类。数据集提供了明确的标签映射关系(如'O'表示非实体,'B-cancer_type'表示癌症类型实体的起始位置),便于直接适配常见的序列标注框架。研究者亦可将其作为基准数据集,用于对比不同模型在合成临床文本上的实体识别能力。
背景与挑战
背景概述
在临床自然语言处理领域,命名实体识别(NER)是提取结构化医疗信息的关键技术,然而真实临床笔记因涉及患者隐私而难以公开获取,严重制约了模型训练与评估。为应对这一困境,relevanthint/scnclab2023数据集应运而生,由研究团队于2023年通过GPT-3 API生成合成临床笔记,并经由三名生物医学专家使用Argilla工具进行精细标注。该数据集聚焦癌症相关临床文本,涵盖过敏、生物标志物、癌症症状、诊断、治疗等20余类实体,旨在为肿瘤学领域的NER研究提供高质量、低隐私风险的基准资源。其发布推动了合成数据在医疗NLP中的应用探索,并为后续研究提供了可复现的评估框架。
当前挑战
该数据集面临的核心挑战在于合成数据的真实性与泛化能力。一方面,基于GPT-3生成的笔记可能无法完全捕捉真实临床记录的语体特征、术语多样性及隐含逻辑,导致模型在真实场景中性能下降。另一方面,构建过程中,专家手动标注虽保证了准确性,但受限于样本量(n<1K),难以覆盖临床实体共现的复杂模式与长尾分布。此外,数据标注的类不平衡问题(如部分实体出现频率极低)增加了模型训练的难度,而合成数据固有的偏见风险(如种族、性别在生成文本中的潜在偏差)亦需谨慎评估,以避免下游应用中的不公平性。
常用场景
经典使用场景
在临床自然语言处理领域,scnclab2023数据集作为一项基于GPT-3 API生成的合成临床笔记资源,为命名实体识别任务提供了精细的标注体系。该数据集涵盖过敏、生物标志物、癌症症状、癌症类型、日期、诊断、性别、影像学选项、检测结果及治疗等20个实体类别,常用于训练和评估面向肿瘤学临床文本的序列标注模型。其经典使用场景聚焦于从非结构化临床叙述中自动抽取关键医学实体,从而支撑智能医疗信息抽取系统的构建与优化。
实际应用
在实际医疗场景中,scnclab2023数据集训练出的模型可集成于临床决策支持系统,辅助医生从电子健康记录中自动提取癌症类型、治疗方案及检测结果等关键信息,从而提升诊疗效率与数据利用水平。此外,该数据集还可用于构建智能病历摘要工具、临床试验患者筛选系统以及医疗质量监控平台,通过自动化信息抽取减少人工录入负担,降低医疗差错风险,推动精准医疗与大健康数据的深度整合。
衍生相关工作
基于scnclab2023数据集,学界已衍生出多项经典工作,包括针对合成临床文本的领域预训练语言模型微调研究、跨实体类型联合抽取框架的提出,以及对比真实临床数据与合成数据在模型泛化能力上的差异分析。这些工作不仅验证了合成数据在医疗NLP任务中的有效性,还催生了面向隐私保护的数据合成评估方法论,并启发了一系列关于数据增强技术、标注一致性校验及模型鲁棒性提升的后续研究,形成了临床文本挖掘领域的重要学术分支。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务