遇见数据集

KenziL/autotrain-data-test

收藏
Hugging Face2023-03-16 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是使用AutoTrain为项目test自动处理的,主要语言为法语(fr)。数据集中的每个样本包含tokens和tags两个字段,tokens字段是一个字符串序列,tags字段是一个类标签序列。数据集被分为训练集和验证集,分别包含999和508个样本。

该数据集是使用AutoTrain为项目test自动处理的,主要语言为法语(fr)。数据集中的每个样本包含tokens和tags两个字段,tokens字段是一个字符串序列,tags字段是一个类标签序列。数据集被分为训练集和验证集,分别包含999和508个样本。

提供机构:
KenziL
原始信息汇总

AutoTrain 项目测试数据集

数据集描述

该数据集由 AutoTrain 自动处理,用于测试项目。

语言

数据集的语言为法语,BCP-47 代码为 fr。

数据集结构

数据实例

数据集的一个样本如下所示:

json [ { "tokens": [ "CCI", "CCI", "CCI", "CCI bifocal G3, 7 et 25 mm", "CCI bifocal G3, 7 et 25 mm", "CCI", "18/04/2019 : mammectomie dt + CA", "18/04/2019 : mammectomie dt + CA", "RO+ 20%", " RO+ 20%", "RO+", "RO+", "18/04/2019 : mammectomie dt + CA", "18/04/2019 : mammectomie dt + CA", "RP-", "RP-", "18/04/2019 : mammectomie dt + CA", "18/04/2019 : mammectomie dt + CA", "HER2 2+", "HER2 2+", "HER2 +", "HER2 +", "18/04/2019 : mammectomie dt + CA", "18/04/2019 : mammectomie dt + CA", "Fish+", "Fish+", "18/04/2019 : mammectomie dt + CA", "18/04/2019 : mammectomie dt + CA", "N+ 17/19", "N+ 17/19", "18/04/2019 : mammectomie dt + CA", "18/04/2019 : mammectomie dt + CA", "CA15-3 : 12 UI", "CA15-3 : 12 UI", "18/04/2019 : mammectomie dt + CA", "18/04/2019 : mammectomie dt + CA", "PS-0", "PS-0", "PS-0", "PS-0", " 03/2020", "08/2020", " 03/2020", "08/2020" ], "tags": [ 28, 28, 28, 37, 37, 28, 14, 14, 29, 29, 29, 29, 32, 32, 33, 33, 34, 34, 19, 19, 19, 19, 20, 20, 17, 17, 18, 18, 23, 23, 24, 24, 6, 6, 7, 7, 27, 27, 27, 27, 12, 12, 12, 12 ] }, { "tokens": [ "K sein D", "1992 : K sein D", "CA15-3 =1890", "CA 15-3 : 5200", "10/18", "11/21", "PS-2", "10/18" ], "tags": [ 28, 14, 6, 6, 7, 7, 27, 12 ] } ]

数据集字段

数据集包含以下字段(也称为“特征”):

json { "tokens": "Sequence(feature=Value(dtype=string, id=None), length=-1, id=None)", "tags": "Sequence(feature=ClassLabel(names=[ALK, ALK_DATE, BRAF, BRAF_DATE, BRCA, BRCA_DATE, CA15-3, CA15-3_DATE, CK20, CK20_DATE, CK7, CK7_DATE, Date PS, Date arru00eat traitement, Date du diagnostic de la tumeur primitive, EGFR, EGFR_DATE, FISH, FISH_DATE, HER2, HER2_DATE, KI67, KI67_DATE, N+, N+_DATE, PDL1, PDL1_DATE, PS, Premier type histologique de cancer, RO, ROS, ROS_DATE, RO_DATE, RP, RP_DATE, TTF1, TTF1_DATE, Taille de la tumeur primitive au diagnostic, motif arru00eat traitement, ru00e9cepteurs hormonaux, ru00e9cepteurs_hormonaux_DATE], id=None), length=-1, id=None)" }

数据集分割

数据集分为训练集和验证集,分割大小如下:

分割名称 样本数量
train 999
valid 508
搜集汇总
数据集介绍
构建方式
该数据集源自AutoTrain自动化流程,专为命名实体识别任务设计,聚焦于法语医学文本的标记分类。构建过程中,原始临床记录被解析为令牌序列,每个令牌对应一个预定义的类别标签,涵盖肿瘤标志物、治疗日期、病理分期等医学实体。数据实例以JSON格式存储,包含'tokens'与'tags'两个核心字段,其中标签采用整数编码映射至40余种实体类型,如'CA15-3'、'HER2'及'PS'等。数据集被划分为训练集与验证集,分别包含999条和508条样本,确保了模型评估的可靠性。
特点
此数据集的核心特色在于其高度专业化的医学实体标注体系,覆盖了乳腺癌诊疗中常见的生物标志物、时间节点及临床评估指标。标签分类细致入微,例如将'CA15-3'与其检测日期'CA15-3_DATE'区分标注,体现了对时间序列信息的精准捕捉。此外,令牌序列中频繁出现重复实体,反映了临床文本中信息复述的自然特征,为模型处理冗余信息提供了训练素材。数据集的语言设定为法语(BCP-47代码'fr'),使其在法语医学自然语言处理领域具有独特价值。
使用方法
使用该数据集时,可借助HuggingFace的datasets库直接加载,通过指定'KenziL/autotrain-data-test'标识符获取。数据以序列形式组织,适合作为令牌分类任务的输入,需将'tokens'字段作为模型输入,'tags'字段作为监督目标。建议采用预训练的多语言或法语BERT模型进行微调,以适配医学领域的语义特征。由于标签为整数索引,需配合ClassLabel映射表将预测结果解码为原始实体名称。训练时可按标准分割使用'train'与'valid'划分,并注意处理令牌长度不一的临床文本特点。
背景与挑战
背景概述
在自然语言处理与医学信息提取的交汇领域,针对非结构化临床文本的实体识别任务日益受到关注。KenziL/autotrain-data-test数据集由AutoTrain平台于近期自动构建,专注于法语医学文本中的肿瘤标志物与临床指标抽取。该数据集以法语为单一语言,核心研究问题在于从乳腺癌患者的病程记录中精准识别如CA15-3、HER2、PS等关键生物标记物及其对应日期,从而为肿瘤学临床决策支持系统提供结构化数据基础。其影响力体现在推动了低资源语言医学命名实体识别(NER)的自动化标注流程,为法语医疗文本的深度挖掘开辟了新路径。
当前挑战
该数据集面临的首要挑战在于医学领域术语的高度专业性与上下文依赖性,例如同一缩写“CCI”在不同语境中可能指代不同临床概念,需模型具备细粒度语义理解能力。其次,构建过程中遭遇了标注一致性难题,数据样例中频繁出现重复令牌与标签序列,暗示自动标注算法可能因文本噪声或格式变异产生冗余对齐,导致训练样本质量参差不齐。此外,类别分布极不均衡,诸如“PS”类标签出现频次远超“BRAF_DATE”等稀有类别,易引发模型对高频实体的过拟合。最后,法语医学文本中特有的日期格式混合(如“18/04/2019”与“03/2020”)与缩写变异(如“RO+ 20%”与“RO+”),进一步加剧了序列标注的歧义性挑战。
常用场景
经典使用场景
在自然语言处理与医学信息学交叉领域,KenziL/autotrain-data-test数据集被广泛用于法语临床文本的实体识别与消歧任务。该数据集聚焦于乳腺癌诊疗记录,通过精细标注肿瘤标志物(如CA15-3、HER2)、治疗事件(如手术日期、放疗方案)及病理分期(如N+、PS)等关键实体,为构建面向非结构化电子病历的命名实体识别模型提供了高质量训练语料。其独特的标签体系涵盖41类细粒度医学概念,尤其适用于研究临床文本中时间表达式与数值型指标的联合抽取,推动了法语医学文本结构化处理技术的发展。
解决学术问题
该数据集有效解决了法语医学文献中实体边界模糊与类别不平衡两大核心挑战。通过提供包含重复标记与上下文重叠的真实临床记录,它促进了序列标注模型对同义表达(如'RO+ 20%'与'RO+')的鲁棒识别能力。学术研究可借此探索基于Transformer的预训练语言模型(如CamemBERT)在医学领域微调时的迁移学习策略,并系统评估CRF层与注意力机制对长距离依赖实体的捕获效果。其公开的标签分布统计为处理医学文本中稀疏类别(如罕见基因突变标记)提供了基准测试平台。
衍生相关工作
该数据集衍生出多项开创性研究,包括基于对比学习的医学实体归一化方法,通过构建同义实体对(如'CA15-3 : 12 UI'与'CA 15-3 : 5200')提升了跨文本实体链接的准确性。后续工作还探索了多任务学习框架,将实体识别与关系抽取联合优化,实现了对'18/04/2019 : mammectomie dt + CA'这类复合事件中手术与化疗时序关系的自动解析。此外,基于该数据训练的模型被成功迁移至法语放射报告的结构化任务,验证了其在跨机构临床文本中的泛化能力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务