遇见数据集

ner-augmentation

收藏
Hugging Face2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

Impresso HIPE-2022 NER 数据集是一个专门用于命名实体识别(NER)任务的数据集,源自 HIPE-2022 共享任务,并为 Impresso NER 模型进行了预处理。数据集的核心内容是从历史报纸文本中提取的命名实体标注数据,涉及德语(de)、英语(en)和法语(fr)三种语言。数据以 token 序列及其对应的 NER 标签形式组织,标注方案采用 IOB2 格式,覆盖了五类粗粒度实体类型:地点(loc)、组织(org)、人物(pers)、产品(prod)和时间(time)。每个数据样本除了 tokens 和 ner_tags 外,还包含元数据字段:日期(date)、来源数据包(bundle,如 hipe2020 或 letemps)和语言(lang),便于按来源和语言进行切片分析。数据集提供了多个配置(或变体),主要围绕 hipe2020 和 letemps 这两个原始数据包及其经过名称替换增强的版本。例如,默认配置 hipe2020-letemps 合并了这两个数据包,包含 23,266 个训练样本、4,832 个开发样本和 5,613 个测试样本。其他配置如 hipe2020-letemps-name-replacement-150 则提供了通过名称替换进行数据增强后规模更大的训练集(58,164 个样本)。数据集适用于历史文本的命名实体识别研究、多语言 NER 模型训练,以及对历史文献进行信息提取等任务。数据遵循 CC BY-NC-SA 4.0 许可协议。

The Impresso HIPE-2022 NER dataset is a specialized dataset for Named Entity Recognition (NER) tasks, derived from the HIPE-2022 shared task and preprocessed for the Impresso NER model. The core content consists of named entity annotations extracted from historical newspaper texts. The data covers three languages: German (de), English (en), and French (fr). It is organized as token sequences with corresponding NER labels, using the IOB2 tagging scheme and covering five coarse-grained entity types: location (loc), organization (org), person (pers), product (prod), and time (time). Each data sample includes tokens and ner_tags, along with metadata fields: date, source bundle (e.g., hipe2020 or letemps), and language (lang), facilitating slice analysis by source and language. The dataset offers multiple configurations or variants, primarily based on the original bundles hipe2020 and letemps and their enhanced versions via name replacement. For example, the default configuration hipe2020-letemps combines these two bundles, containing 23,266 training samples, 4,832 development samples, and 5,613 test samples. Other configurations, such as hipe2020-letemps-name-replacement-150, provide larger training sets (58,164 samples) through data augmentation via name replacement. The dataset is suitable for research on named entity recognition in historical texts, multilingual NER model training, and information extraction from historical documents. The data is licensed under CC BY-NC-SA 4.0.

创建时间:
2026-06-22
搜集汇总
数据集介绍
ner-augmentation 数据集图片
构建方式
该数据集的构建源自HIPE-2022共享任务中的hipe2020数据包,经过精心的整理与加工以适应Impresso命名实体识别模型的训练需求。训练集与开发集取自v2.1版本,而测试集则来源于v2.1-test-all-unmasked版本,该版本是在评估后发布的带有真实标签的数据。数据集以Parquet格式存储,保留了tokens、ner_tags等核心字段,并额外包含bundle、lang和date信息,使得记录可按来源和语言进行灵活切片。原始HIPE CoNLL TSV文件也被完整保留在raw目录下,供需要全部注释层的用户使用。
特点
该数据集涵盖了德、英、法三种语言,采用IOB2标注方案对地名、组织、人物、产品及时间五类实体进行精细标记。其独特之处在于提供了多个配置变体,包括名称替换和OCR噪声模拟,以增强模型的泛化能力。名称替换配置通过替换实体名称来扩充训练数据,而OCR噪声配置则模拟光学字符识别错误,使模型能更好地应对历史文档中的识别噪声。这些变体共同构成了一个多维度、高鲁棒性的命名实体识别资源,特别适用于历史报纸等复杂文本场景。
使用方法
用户可通过Hugging Face Datasets库加载该数据集,根据需求选择不同配置,如hipe2020、hipe2020-letemps或带有名称替换和OCR噪声的变体。数据集已预先分为训练、开发和测试子集,且每个子集均有明确的样本数量。加载后,用户可直接获取tokens和对应的ner_tags列表,以及日期、来源和语言等辅助信息。对于需要完整注释层的用户,可通过raw路径访问原始CoNLL格式文件。该数据集采用CC BY-NC-SA 4.0许可,适用于学术研究和教育场景。
背景与挑战
背景概述
命名实体识别(NER)作为自然语言处理领域的基础任务,在历史文献数字化进程中扮演着关键角色。Impresso HIPE-2022 NER数据集由Impresso项目团队于2022年构建,依托HIPE-2022共享任务中的`hipe2020`数据包,汇聚了德语、英语和法语三语种的历史报纸语料。该数据集旨在推动面向历史文档的NER研究,其标注体系采用IOB2格式,覆盖位置、组织、人物、产品及时间五大实体类别。通过提供包含训练、验证和测试三部分的标准分割,该数据集为评估模型在历史文本上的泛化能力树立了基准,对数字人文领域的实体抽取研究产生了重要影响。
当前挑战
历史文档NER面临的核心挑战在于语言演化和OCR噪声带来的标注歧义。该数据集所解决的领域难题是,如何从拼写多变、语法非规范的19至20世纪报章中准确识别命名实体。构建过程中,团队需处理跨语言标注一致性、实体类别边界模糊(如产品与组织名交叉)等问题。此外,数据集还引入OCR噪声模拟和名称替换增强版配置,以应对真实场景中字符识别错误导致的实体遗漏或误标,这要求模型具备对字形畸变和词汇替换的鲁棒性,从而提升历史文本知识抽取的可靠性。
常用场景
经典使用场景
在数字人文与历史文本挖掘领域,命名实体识别(NER)是解锁海量历史报纸中结构化信息的关键技术。Impresso HIPE-2022 NER数据集专为历史报纸文本的实体识别任务而设计,支持德语、英语和法语三种语言。其经典使用场景集中于训练和评估能够从19至20世纪历史报纸中准确提取地点、组织、人物、产品及时间等实体的模型。数据集中包含的OCR噪声变体(如cer30)和名称替换变体,使得研究者能够模拟真实历史文本中的光学字符识别错误与实体分布变化,从而开发出对噪声与数据偏移具有鲁棒性的NER系统。该数据集的多源(bundle)和日期标注特性,还支持跨语种、跨时间与跨来源的实体识别性能对比分析,为历史文本信息抽取提供了标准化的基准平台。
解决学术问题
该数据集的核心学术贡献在于解决了历史报纸文本中命名实体识别面临的独特挑战。传统NER数据集多基于清洁的现代文本,而历史语料普遍存在拼写不规范、OCR引入的字符噪声以及实体表示随时间演变等问题。Impresso HIPE-2022通过提供包含四种不同程度OCR噪声(从0%到100%重采样至30%字符错误率)的配置,使得研究者能够系统性地探究噪声对NER模型性能的影响,并发展抗噪的序列标注方法。其名称替换变体(如name-replacement-150)则针对历史文本中人物名称稀疏性及长尾分布问题,提供数据增强方案。这些设计推动了领域适应与鲁棒性学习在数字人文领域的理论进展,为构建能够泛化至非标准历史文本的命名实体识别模型奠定了方法论基础。
衍生相关工作
Impresso HIPE-2022 NER数据集催生了多项具有影响力的相关工作。在自然语言处理领域,研究者基于该数据集提出了融合版面分析与文本特征的跨模态NER方法,用于处理历史报纸中的多列排版与复杂布局。在数据增强方向,名称替换配置启发了针对稀疏实体类别的合成数据生成策略,相关方法被后续工作扩展至低资源语言的历史文本处理。该数据集同时是HIPE-2022共享任务的核心基准,参赛团队开发了混合BERT与CRF的序列标注模型、基于Transformer的跨语言迁移学习框架,以及针对OCR噪声设计的字符级对抗训练方法。在数字人文研究中,该数据集催生了关于历史报纸中实体分布随时间演化规律的定量分析,推动了事件衍生命名实体识别等新研究议题的提出,形成了一个连接计算语言学与历史学的跨学科研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务