遇见数据集

nlpso/m1_qualitative_analysis_ocr_cmbert_io

收藏
Hugging Face2023-02-22 更新2024-03-04 收录
官方服务:

资源简介:

该数据集用于对[Jean-Baptiste/camembert-ner](https://huggingface.co/Jean-Baptiste/camembert-ner)模型在嵌套NER任务上进行定性分析,使用的是独立NER层的方法[M1]。数据集包含19世纪巴黎的贸易目录条目。数据集参数包括方法(M1)、类型(noisy,Pero OCR)、使用的分词器([Jean-Baptiste/camembert-ner](https://huggingface.co/Jean-Baptiste/camembert-ner))、标记格式(IO)、数据量(Train: 6084, Dev: 676, Test: 1685)以及相关的微调模型(Level-1: [nlpso/m1_ind_layers_ocr_cmbert_io_level_1](https://huggingface.co/nlpso/m1_ind_layers_ocr_cmbert_io_level_1), Level 2: [nlpso/m1_ind_layers_ocr_cmbert_io_level_2](https://huggingface.co/nlpso/m1_ind_layers_ocr_cmbert_io_level_2))。实体类型包括O(Outside of a named entity)、PER(Person or company name)、ACT(Person or company professional activity)、TITREH(Military or civil distinction)、DESC(Entry full description)、TITREP(Professionnal reward)、SPAT(Address)、LOC(Street name)、CARDINAL(Street number)、FT(Geographical feature)。

本数据集用于对[Jean-Baptiste/camembert-ner](https://huggingface.co/Jean-Baptiste/camembert-ner)模型开展嵌套命名实体识别(Named Entity Recognition,NER)任务的定性分析,所采用的方法为独立NER层方法[M1]。 数据集涵盖19世纪巴黎的贸易目录条目。其配置参数包括:所用方法(M1)、数据类型(含噪声(noisy)、Pero光学字符识别(Pero OCR)两类)、所使用的分词器(Tokenizer)[Jean-Baptiste/camembert-ner](https://huggingface.co/Jean-Baptiste/camembert-ner)、标记格式(IO格式)、数据规模(训练集6084条、开发集676条、测试集1685条)以及配套微调模型:一级模型(Level-1)为[nlpso/m1_ind_layers_ocr_cmbert_io_level_1](https://huggingface.co/nlpso/m1_ind_layers_ocr_cmbert_io_level_1),二级模型(Level 2)为[nlpso/m1_ind_layers_ocr_cmbert_io_level_2](https://huggingface.co/nlpso/m1_ind_layers_ocr_cmbert_io_level_2)。 所涵盖的实体类型包括:O(非命名实体外(Outside of a named entity))、PER(人物或企业名称(Person or company name))、ACT(人物或企业的职业活动(Person or company professional activity))、TITREH(军事或民事荣誉称号(Military or civil distinction))、DESC(条目完整描述(Entry full description))、TITREP(职业奖励(Professionnal reward))、SPAT(地址(Address))、LOC(街道名称(Street name))、CARDINAL(街道门牌号(Street number))、FT(地理特征(Geographical feature))。

提供机构:
nlpso
原始信息汇总

数据集概述

数据集名称

m1_qualitative_analysis_ocr_cmbert_io

数据集描述

本数据集用于对Jean-Baptiste/camembert-ner进行嵌套命名实体识别任务的定性分析,采用独立NER层方法[M1]。数据集包含19世纪巴黎贸易目录的条目。

数据集参数

实体类型

缩写 实体组(级别) 描述
O 1 & 2 非命名实体
PER 1 人名或公司名
ACT 1 & 2 人或公司的职业活动
TITREH 2 军事或民事区别
DESC 1 条目完整描述
TITREP 2 职业奖励
SPAT 1 地址
LOC 2 街道名称
CARDINAL 2 街道号码
FT 2 地理特征

如何使用数据集

python from datasets import load_dataset

train_dev_test = load_dataset("nlpso/m1_qualitative_analysis_ocr_cmbert_io")

搜集汇总
数据集介绍
构建方式
该数据集旨在对基于独立NER层方法(M1)的Jean-Baptiste/camembert-ner模型在嵌套命名实体识别任务上进行定性分析。数据源自19世纪巴黎贸易目录条目,经由Pero OCR系统处理产生噪声文本,并采用IO标注格式进行实体标记。数据集按层级划分实体类型,其中第一层涵盖PER(人物或公司名)、ACT(专业活动)、DESC(完整描述)及SPAT(地址),第二层则进一步细化为TITREH(军事或民事荣誉)、TITREP(职业奖励)、LOC(街道名)、CARDINAL(门牌号)与FT(地理特征)。训练集、开发集与测试集分别包含6084、676及1685条样本,与两个微调模型(层级一与层级二)相关联,以支持嵌套NER的逐层评估。
特点
数据集的核心特点在于其针对嵌套NER任务的层级化构建与噪声环境下的鲁棒性检验。通过将实体划分为两个层次,第一层捕获粗粒度实体(如人物、地址),第二层揭示细粒度属性(如街道编号、荣誉头衔),从而模拟真实世界中实体嵌套的复杂结构。数据来源于历史文献的OCR输出,引入了拼写错误、字符变形等典型噪声,为评估模型在非理想条件下的泛化能力提供了严苛测试场景。IO标注格式的简洁性进一步凸显了模型对边界识别的依赖,而多层级标签体系则允许研究者独立分析各层次的表现,为嵌套NER的错误传播与层级交互研究奠定了基础。
使用方法
数据集可通过HuggingFace Datasets库直接加载,使用简单命令即可获取训练、开发与测试分割。加载后,用户可利用其层级标签结构进行嵌套NER模型的训练与评估,例如结合提供的微调模型(nlpso/m1_ind_layers_ocr_cmbert_io_level_1与level_2)进行逐层推理。数据集的IO格式要求模型在预测时严格区分实体边界,适合作为基准测试集用于对比不同嵌套NER方法(如序列标注、多任务学习)的性能。研究者还可通过修改加载参数对特定层级或实体类型进行过滤分析,以深入探究模型在噪声历史文本中的错误模式。
背景与挑战
背景概述
在自然语言处理领域,嵌套命名实体识别(Nested NER)是一项极具挑战性的任务,其核心在于实体之间的层级嵌套结构,例如地址中包含街道名称与门牌号。该数据集由nlpso团队于近年创建,聚焦于19世纪巴黎贸易名录的OCR识别文本,旨在评估独立NER层方法(M1)在嵌套NER任务中的表现。研究基于Jean-Baptiste/camembert-ner分词器,采用IO标注格式,并针对噪声OCR数据设计了层级实体类型,涵盖人员、职业、地址等细粒度类别。该数据集不仅为历史文档的数字化理解提供了基准,还推动了OCR与NER技术的交叉融合,对文化遗产数字化领域具有重要影响力。
当前挑战
数据集面临的核心挑战包括:1)嵌套NER的层级解析难题,实体如“TITREH”(军事荣誉)与“TITREP”(职业奖励)需在两层标注中准确区分,传统平面NER方法难以捕捉其层级依赖关系;2)OCR噪声的干扰,19世纪印刷文本的字符残缺、模糊等问题导致实体边界模糊,加剧了标注歧义;3)构建过程中,手工标注层级实体需兼顾历史语义与语言学规则,例如“ACT”(职业活动)与“DESC”(描述)的界定依赖上下文,标注一致性难以保障;4)数据规模有限(训练集仅6084条),限制了模型对罕见实体类型(如“FT”)的泛化能力。
常用场景
经典使用场景
该数据集专为嵌套命名实体识别任务中的定性分析而设计,聚焦于19世纪巴黎商业名录的OCR噪声文本。其经典使用场景在于评估独立NER层方法(M1)在多层实体结构上的性能,通过IO标注格式对实体进行层级划分,例如将地址(SPAT)拆解为街道名称(LOC)、门牌号(CARDINAL)和地理特征(FT),从而验证模型对嵌套实体的解耦能力。研究者可基于此数据集微调层级化NER模型,并对比不同标注策略在历史文档上的鲁棒性。
衍生相关工作
该数据集催生了多项经典工作,包括基于独立NER层(M1)的两阶段微调模型(如nlpso/m1_ind_layers_ocr_cmbert_io_level_1与level_2),这些模型首次将CamemBERT架构应用于嵌套实体层级预测。后续工作进一步探索了OCR噪声对层级标签一致性的影响,并衍生出多任务联合训练框架(如同时优化扁平与嵌套NER损失)。此外,该数据被用于对比IO与BIO标注在嵌套场景下的优劣,推动了跨语言(法语)历史文档NER的标准化评估协议建立。
数据集最近研究
最新研究方向
在历史文档分析与自然语言处理的交叉领域中,嵌套命名实体识别(Nested NER)正成为前沿焦点。该数据集聚焦于19世纪巴黎商业名录的OCR噪声文本,采用独立NER层(M1)策略对嵌套实体进行定性分析,突破了传统扁平NER的局限。结合CamemBERT预训练模型,研究旨在提升对历史手写体与印刷体文档中复杂实体关系(如人物、地址、职业与荣誉头衔的层级嵌套)的抽取精度。这一方向与数字人文浪潮下大规模历史档案的智能化解析紧密相关,尤其为法国乃至欧洲文化遗产的数字化保护与知识图谱构建提供了基准资源,推动了低资源历史语言场景下多层级实体识别的可解释性研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务