遇见数据集

Srilankan-Tamil-NER

收藏
Hugging Face2026-05-25 更新2026-05-26 收录
官方服务:

资源简介:

斯里兰卡泰米尔语命名实体识别(NER)数据集是一个高质量、专门针对斯里兰卡(贾夫纳)地区语境的泰米尔语命名实体识别数据集。该数据集由ExentAI构建和整理,旨在补充通用印度语言NER模型在识别斯里兰卡地名、泰米尔组织及地区人物等实体方面的不足,适用于低资源泰米尔语NLP研究。数据集包含10,195个经过精心标注的句子,总计16,012个命名实体,其中50%的句子至少包含一个命名实体。数据来源于15本泰米尔文学与历史书籍(6,393句)以及一个地区新闻和文档语料库(3,802句)。数据采用IOB2标注格式,严格遵循与`ai4bharat/IndicNER`兼容的Naamapadam标签模式,包含三类实体:人物(PER)、地点(LOC)和组织(ORG)。数据结构包含三个字段:唯一句子ID(`id`)、词元列表(`words`)和对应的整数标签ID列表(`ner`)。数据集已预先划分为训练集(约8,156句)、验证集(约1,020句)和测试集(约1,019句)。数据质量方面,该数据集经过严格验证,确保零BIO序列错误,修复了孤立的`I-`标签和连续的`B-`标签链,并强制执行了每句最大50个词元的长度限制。其主要用于微调面向斯里兰卡泰米尔文本的Indic NER模型,提升贾夫纳地区泰米尔文档的实体检测能力,以及构建泰米尔文档处理与知识图谱管道。

The Sri Lankan Tamil Named Entity Recognition (NER) dataset is a high-quality, context-specific Tamil NER dataset tailored for the Sri Lankan (Jaffna) regional context. This dataset was constructed and curated by ExentAI, aiming to address the shortcomings of general-purpose Indian language NER models in recognizing entities such as Sri Lankan toponyms, Tamil organizations, and regional figures, and is suitable for low-resource Tamil NLP research. The dataset contains 10,195 meticulously annotated sentences, totaling 16,012 named entities, with 50% of the sentences containing at least one named entity. The data is sourced from 15 Tamil literary and historical books (6,393 sentences) and a regional news and document corpus (3,802 sentences). The data adopts the IOB2 annotation format, strictly follows the Naamapadam label schema compatible with `ai4bharat/IndicNER`, and includes three types of entities: Person (PER), Location (LOC), and Organization (ORG). The dataset structure includes three fields: unique sentence ID (`id`), token list (`words`), and the corresponding integer label ID list (`ner`). The dataset has been pre-split into training set (~8,156 sentences), validation set (~1,020 sentences), and test set (~1,019 sentences). In terms of data quality, the dataset has undergone rigorous validation to ensure zero BIO sequence errors, fixes isolated `I-` tags and consecutive `B-` tag chains, and enforces a maximum token length limit of 50 tokens per sentence. It is primarily used for fine-tuning Indic NER models targeted at Sri Lankan Tamil texts, enhancing entity detection performance for Tamil documents in the Jaffna region, and constructing Tamil document processing and knowledge graph pipelines.

创建时间:
2026-05-22
原始信息汇总

数据集概述:Sri Lankan Tamil NER

  • 数据集名称:Sri Lankan Tamil NER
  • 语言:泰米尔语(ta
  • 许可证:Creative Commons Attribution 4.0 International (CC BY 4.0)
  • 任务类别:Token Classification → Named Entity Recognition (NER)
  • 数据集规模:10,195 个句子(10K < n < 100K)
  • 标签格式:IOB2
  • 区域焦点:斯里兰卡(贾夫纳地区)

数据集详情

数据来源与组成

来源 句子数
书籍 V1–V15(泰米尔文学与历史文本) 6,393
Final_Tamil Corpus(区域新闻与文档) 3,802
总计 10,195

实体分布

实体类型 数量
B-PER(人物) 4,533
B-LOC(地点) 8,110
B-ORG(组织) 3,369
实体总数 16,012
  • 50% 的句子包含至少一个命名实体。

标签模式

遵循 Naamapadam schema,与 ai4bharat/IndicNER 完全兼容:

ID 标签 描述
0 O 非实体
1 B-PER 人物名称开始
2 I-PER 人物名称内部
3 B-LOC 地点开始
4 I-LOC 地点内部
5 B-ORG 组织开始
6 I-ORG 组织内部

数据集结构

数据字段

python { "id": "0", # 唯一句子 ID(字符串) "words": ["யாழ்ப்பாணம்", "உள்ள", "..."], # 单词令牌列表 "ner": [3, 0, ...] # 每个单词对应的整数标签 ID 列表 }

数据集拆分

拆分 句子数
训练集 ~8,156
验证集 ~1,020
测试集 ~1,019
总计 10,195

数据质量

  • 零 BIO 错误:所有 IOB2 标签序列已完全验证。
  • 孤立的 I- 标签已修复:没有匹配 B- 的连续标签已修正。
  • 连续 B- 标签已合并:同一实体类型的连续 B- 标签已正确合并。
  • 最大令牌长度 50:在预处理中严格执行。

预期用途

  • 斯里兰卡泰米尔语文本 上微调 Indic NER 模型。
  • 提升 贾夫纳领域泰米尔文档 的实体检测能力。
  • 用于 低资源泰米尔语 NLP 研究。
  • 构建泰米尔文档处理与知识图谱管道。

数据整理与标注

  • 来源:15 本泰米尔文学/历史书籍 + 区域泰米尔语语料库。
  • 标注方法:GPT 辅助的 CoNLL 格式标注,并自动进行 BIO 验证。
  • 预处理:句子分割、令牌长度限制、BIO 错误修正。
  • 组织:ExentAI

引用

如使用该数据集,请引用:

bibtex @dataset{exentai_srilankan_tamil_ner, author = {ExentAI}, title = {Sri Lankan Tamil NER}, year = {2025}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/exentai/Srilankan-Tamil-NER} }

搜集汇总
数据集介绍
Srilankan-Tamil-NER 数据集图片
构建方式
该数据集的构建融合了多元语料来源与精细化校验流程。其语料取自15本泰米尔文学与历史著作(共计6393句),以及聚焦斯里兰卡地区新闻与文档的泰米尔语料库(3802句),总计10195句。在标注环节,采用GPT辅助的CoNLL格式标注策略,并辅以自动化的BIO序列校验,确保每一条标签序列严格遵循IOB2规范。经系统性修复孤立的I标签与连续的B标签错误后,最终数据集实现了零BIO错误的严苛质量标准,所有句子长度均被限定在50个token以内,为模型训练提供了高度洁净的输入环境。
特点
本数据集最显著的特征在于其对斯里兰卡(尤以贾夫纳地区为焦点)泰米尔语实体识别能力的深度强化。相较通用型Indic NER模型,该数据集专门覆盖了斯里兰卡地名、泰米尔组织及地区性人物等常被遗漏的实体类型,共包含16012个标注实体,其中地点类实体(B-LOC)以8110例居首,人物(B-PER)与组织(B-ORG)实体分别达4533例与3369例。此外,数据集严格遵循Naamapadam标注模式,与ai4bharat/IndicNER框架完全兼容,约半数的句子内含至少一个命名实体,使得其在低资源泰米尔语自然语言处理研究中具有独特价值。
使用方法
研究者可通过Hugging Face Datasets库一键加载该数据集,调用load_dataset('exentai/Srilankan-Tamil-NER')即可获取划分为训练集(约8156句)、验证集(约1020句)与测试集(约1019句)的标准数据分割。在模型训练层面,数据集提供了从标签ID到名称的完整映射字典(ID2LABEL与LABEL2ID),便于与Transformers库中的预训练模型(如ai4bharat/IndicNER)无缝对接。使用时,仅需加载对应分词器与分类头配置,忽略大小不匹配的参数即可启动微调,适用于构建泰米尔语文档处理与知识图谱管道。
背景与挑战
背景概述
Srilankan-Tamil-NER数据集由ExentAI团队于2025年创建,专门针对斯里兰卡泰米尔语(尤其是贾夫纳地区)的命名实体识别(NER)任务。该数据集包含10,195句精心标注的句子,覆盖斯里兰卡地名、泰米尔组织和地区性人物等通用Indic NER模型常遗漏的实体。其核心研究问题在于解决低资源语言中区域特异性实体的识别难题,通过整合15本泰米尔文学历史文本与区域语料库(共计10,195句),构建了基于IOB2标注格式的高质量资源。该数据集遵循Naamapadam标注体系,与ai4bharat/IndicNER完全兼容,为泰米尔语NLP研究提供了关键基准,尤其推动了斯里兰卡泰米尔语文本处理与知识图谱构建的发展。
当前挑战
该数据集所解决的领域问题包括:通用Indic NER模型对斯里兰卡泰米尔语区域实体(如贾夫纳地名、本土组织)识别能力不足,导致语言资源稀缺下的实体抽取精度低下。构建过程中面临的挑战有三:其一,语料来源多样化(15本书籍与区域新闻文档),需统一标注规范并消除异质性;其二,标注采用GPT辅助的CoNLL格式与自动化BIO校验,但需严格避免空I标签和B-B链错误,最终实现零BIO错误;其三,需严格限制句子长度不超过50个token以适配模型输入,并在保持高标注质量(16,012个实体中50%句子含实体)的同时平衡数据分布,最终通过训练/验证/测试集划分(约8,156/1,020/1,019句)确保模型的泛化能力。
常用场景
经典使用场景
在低资源语言的自然语言处理领域,斯里兰卡泰米尔语命名实体识别数据集(Srilankan-Tamil-NER)为训练和评估面向泰米尔语的序列标注模型提供了核心基准。该数据集包含10,195条经过严格校验的句子,采用IOB2标注格式,涵盖人名、地名和组织机构三大实体类别,其中地理实体数量最为丰富,共计8,110个。研究者通常利用其训练集中的8,156条样本对预训练语言模型(如IndicNER)进行微调,并在验证集和测试集上评估模型对斯里兰卡贾夫纳地区特有实体的识别能力,从而推动区域化泰米尔语信息抽取技术的发展。
解决学术问题
该数据集解决了泰米尔语命名实体识别研究中一个长期存在的痛点:通用印地语NER模型在斯里兰卡语境下的表现显著下降。由于斯里兰卡泰米尔语包含大量独特的地名(如贾夫纳地区的村庄名)、本地组织名称以及具有区域特征的人名,通用模型常将其误标为无关类别。该数据集通过零BIO错误的高质量标注,为这类区域化实体识别提供了可靠的训练与评测资源,其意义在于突破了低资源语言NER研究中因地域差异导致的模型泛化瓶颈,为构建更具包容性的多方言NLP系统奠定了数据基础。
衍生相关工作
该数据集衍生出多项推动低资源泰米尔语NLP发展的经典工作。首先,其与Naamapadam标注体系及IndicNER模型的兼容性,促进了跨语种NER研究中的迁移学习实验。其次,研究者基于该数据集开发了区域方言感知的微调策略,通过对比通用泰米尔语与斯里兰卡变体的实体分布差异,优化了token级别的分类边界。此外,该数据集被用于验证自动标注与人工校验结合的工作流有效性,其零BIO错误的质量控制流程成为后续低资源数据集构建的参考范式。这些工作共同展现了该数据集在方法论验证、模型适配及数据工程规范方面的深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务