遇见数据集

avramandrei/histnero

收藏
Hugging Face2024-05-02 更新2024-06-12 收录
官方服务:

资源简介:

HistNERo数据集是一个历史罗马尼亚语命名实体识别数据集,包含10,026个句子(即8,020个训练集、1,003个验证集和1,003个测试集),每个句子都标注了五种命名实体:PERSON(人物)、ORGANIZATION(组织)、LOCATION(地点)、PRODUCT(产品)和DATE(日期)。数据集的每个样本包含id、ner_tags、tokens、doc_id和region等特征。数据集的任务类别是token-classification,语言是罗马尼亚语,标签包括ner、history和romanian,大小类别为10K<n<100K。

HistNERo数据集是一个历史罗马尼亚语命名实体识别数据集,包含10,026个句子(即8,020个训练集、1,003个验证集和1,003个测试集),每个句子都标注了五种命名实体:PERSON(人物)、ORGANIZATION(组织)、LOCATION(地点)、PRODUCT(产品)和DATE(日期)。数据集的每个样本包含id、ner_tags、tokens、doc_id和region等特征。数据集的任务类别是token-classification,语言是罗马尼亚语,标签包括ner、history和romanian,大小类别为10K<n<100K。

提供机构:
avramandrei
原始信息汇总

数据集概述

数据集名称

  • HistNERo

数据集描述

  • 包含10,026个句子,分为训练集(8,020个样本)、验证集(1,003个样本)和测试集(1,003个样本),用于历史罗马尼亚语的命名实体识别。

数据集特征

  • id: 字符串类型
  • ner_tags: 序列类型,包含以下类别:
    • 0: O
    • 1: B-PERS
    • 2: I-PERS
    • 3: B-ORG
    • 4: I-ORG
    • 5: B-LOC
    • 6: I-LOC
    • 7: B-PROD
    • 8: I-PROD
    • 9: B-DATE
    • 10: I-DATE
  • tokens: 字符串序列类型
  • doc_id: 字符串类型
  • region: 字符串类型

数据集划分

  • 训练集: 8020个样本,大小为4446694.039497307字节
  • 测试集: 1003个样本,大小为556113.9802513465字节
  • 验证集: 1003个样本,大小为556113.9802513465字节

数据集大小

  • 下载大小: 1458677字节
  • 数据集大小: 5558922字节

任务类别

  • 令牌分类

语言

  • 罗马尼亚语

标签

  • ner
  • history
  • romanian

大小类别

  • 10K<n<100K
搜集汇总
数据集介绍
avramandrei/histnero 数据集图片
构建方式
HistNERo数据集旨在服务于罗马尼亚语历史文本中的命名实体识别任务,其构建根植于对19至20世纪罗马尼亚语历史文献的系统性挖掘。数据来源涵盖报纸、官方文件与私人信函等多样化的历史语料,经过严格的文本数字化与清洗流程后,由语言学专家依据预定义的实体类别——人物、组织、地点、产品及日期——进行精细的序列标注。标注过程遵循BIO标注范式,确保了每个实体边界的清晰界定,最终形成了包含逾万句子的高质量标注语料库,并按8:1:1的比例划分为训练、验证与测试子集。
使用方法
使用者可通过HuggingFace的datasets库便捷加载该数据集,只需调用`load_dataset("avramandrei/histnero")`即可获取结构化的数据对象。每个样本以字典形式呈现,包含唯一标识符、分词后的令牌序列、对应的NER标签序列(以整数编码表示)、来源文档ID及区域信息。该格式与常见的序列标注框架高度兼容,可直接用于训练基于Transformer的预训练语言模型,如BERT或RoBERTa,进行微调以实现历史文本中的命名实体识别任务。
背景与挑战
背景概述
在自然语言处理领域,命名实体识别(NER)作为信息抽取的核心任务,长期受限于历史文本的语言演变与标注资源匮乏。2024年,由Andrei-Marius Avram等学者联合罗马尼亚多所研究机构创建的HistNERo数据集,聚焦于罗马尼亚语历史文本的实体识别,旨在填补该语言在历史语料上的空白。该数据集包含10,026个句子,涵盖人物、组织、地点、产品及日期五类实体,语料源自19至20世纪的罗马尼亚文献,如《布拉索夫公报》等。其发布不仅为低资源语言的历时性NER研究提供了基准,更推动了数字人文与计算语言学的交叉应用,成为评估模型在语言变迁下泛化能力的重要资源。
当前挑战
HistNERo数据集面临的核心挑战在于历史文本特有的语言变异与标注复杂性。首先,罗马尼亚语历史词汇的拼写不统一(如使用古体字母、变音符号)和语法结构差异,显著增加了实体边界识别的难度,例如产品类实体常以缩写或异体形式出现。其次,标注过程中需兼顾历史语境与实体类别平衡,如DATE实体在文献中可能隐含于叙事中而非显式标记。此外,数据集规模较小(约10k句子),且语料地域性较强(集中于特兰西瓦尼亚地区),导致模型易受领域偏移影响,难以泛化至其他历史时期或方言变体。这些挑战共同制约了NER系统在历史文本上的鲁棒性与迁移能力。
常用场景
经典使用场景
HistNERo数据集专为历史文本中的命名实体识别任务而设计,聚焦于罗马尼亚语历史文献的语义解析。其经典使用场景在于训练和评估能够从19至20世纪罗马尼亚语文本中精准抽取人物、组织、地点、产品及日期等五类实体的深度学习模型。由于历史语言在拼写、语法和词汇层面与现代标准语存在显著差异,该数据集为构建鲁棒的历史语言处理系统提供了标准化的训练与测试基准,尤其适用于处理OCR噪声与古语变体。
解决学术问题
该数据集核心解决了罗马尼亚语历史文本中命名实体识别领域长期缺乏高质量标注资源的学术困境。传统NER模型因历史语料的稀疏性、语言演变导致的标注不一致性以及领域特异性而表现欠佳。HistNERo通过提供超过一万句的精细人工标注语料,使得研究者能够系统探索跨时代语言迁移学习、低资源场景下的实体识别泛化能力,以及历史文本中实体边界模糊与类别歧义消解等关键问题,推动了计算语言学与数字人文的交叉研究。
实际应用
在实际应用中,HistNERo驱动的NER模型可赋能罗马尼亚历史档案的数字化整理与知识图谱构建。例如自动从报纸、手稿或官方文书中提取历史人物关系、地理变迁事件及产品流通记录,辅助历史学家进行大规模文本挖掘。此外,该数据集支持文化遗产机构实现古籍目录的自动化标引、地名演变的时空分析,以及历史文献的语义检索系统开发,显著提升人文研究的数字化效率。
数据集最近研究
最新研究方向
在自然语言处理与数字人文学科交叉的前沿领域,面向低资源语言的历时性命名实体识别研究正成为一大热点。HistNERo数据集的问世,为罗马尼亚语历史文本的语义理解开辟了新路径。该数据集聚焦于19世纪至20世纪初的罗马尼亚语语料,涵盖了人物、组织、地点、产品及日期五类实体,其精细化的标注体系与跨区域的文档元数据,使其成为探索语言演变与文化记忆数字化的重要资源。当前,基于Transformer架构的预训练模型在该数据集上的基准测试持续推动着历史语言建模的进步,尤其在不规则拼写、词汇更迭及语法变迁等复杂场景下,命名实体识别技术的鲁棒性提升正成为研究焦点。这一工作不仅助力于巴尔干地区历史文献的自动化整理与知识图谱构建,也为多语言、多时态的自然语言理解提供了宝贵范本,彰显了计算语言学在文化遗产保护中的深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务