遇见数据集

saraiki-linguistic-super-dataset

收藏
Hugging Face2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

该数据集是一个多语言/方言的语料库,包含 7 个训练样本。每个样本包含文本(text)及其对应的词性标注(upos, xpos)、词形还原(lemmas)、依存关系(dependency_heads, dependency_relations)、命名实体标签(ner_tags)、多词表达式标签(mwe_tags)、形态特征(morphology,包括人称、数、性、格、时态、体、语气、语态)、语义角色(semantic_roles)、指代(coreference)等信息。此外,还提供了方言信息(macro_dialect, local_variety, dialect_region, dialect_confidence, dialect_basis)、代码切换(code_switch, matrix_language, token_languages)、语域(register)、语言(language)和文字(script)等元数据。数据集基于 CC-BY-NC-4.0 许可证发布,适用于语言学分析、词性标注、命名实体识别、依存分析、语义角色标注、指代消解、方言识别等自然语言处理任务。

This dataset is a multilingual/dialectal corpus containing 7 training samples. Each sample includes text and its corresponding part-of-speech tags (upos, xpos), lemmas, dependency relations (dependency_heads, dependency_relations), named entity tags (ner_tags), multi-word expression tags (mwe_tags), morphological features (morphology, including person, number, gender, case, tense, aspect, mood, voice), semantic roles (semantic_roles), and coreference (coreference). Additionally, it provides metadata such as dialect information (macro_dialect, local_variety, dialect_region, dialect_confidence, dialect_basis), code-switching (code_switch, matrix_language, token_languages), register, language, and script. The dataset is released under the CC-BY-NC-4.0 license and is suitable for linguistic analysis, part-of-speech tagging, named entity recognition, dependency parsing, semantic role labeling, coreference resolution, dialect identification, and other natural language processing tasks.

创建时间:
2026-08-15
原始信息汇总

Saraiki 语言超级数据集 (saraiki-linguistic-super-dataset)

数据集概述

这是一个面向萨莱基语(Saraiki) 的多层级语言资源数据集,旨在为自然语言处理任务提供丰富的语言学标注信息。数据集包含7个训练样本,总大小约7KB

许可与授权

  • 许可证:CC BY-NC 4.0(知识共享-非商业使用-相同方式共享4.0国际版),仅允许非商业用途。

数据特征

数据集包含25个特征字段,覆盖从词汇到句法、语义、语篇等多维度标注:

类别 特征
基础文本 idtexttokenslemmas
词法标注 upos(通用词性)、xpos(特定词性)、morphology(形态标注:人称、数、性、格、时态、体、语气、语态)
句法标注 dependency_heads(依存头)、dependency_relations(依存关系)
命名实体 ner_tags(命名实体标注)
多词表达 mwe_tags(多词表达式标签)
方言信息 macro_dialect(宏观方言)、local_variety(本地变体)、dialect_region(方言区域)、dialect_confidence(方言置信度)、dialect_basis(方言判定依据)
语码混合 code_switch(语码切换)、matrix_language(主语言)、token_languages(词元语言)
语义标注 semantic_roles(语义角色:谓词索引、跨度起止、角色标签)
指代消解 coreference(指代簇:簇ID、提及的token起止)
语域与语言 register(语域)、language(语言)、script(文字系统)
来源与验证 source_type(来源类型)、generation_model(生成模型)、prompt_version(提示词版本)、research_grounded(研究依据)、verified(验证状态)、verification_score(验证评分)

数据拆分

  • 单一训练集:共7个样本,序列化大小为7083字节

技术说明

  • 下载总大小:25,654字节(约25KB)
  • 数据文件路径:data/train-*(通配符匹配)
  • 包含完整的形态学、依存句法、语义角色、指代消解等深度语言学标注工具链信息。
搜集汇总
数据集介绍
saraiki-linguistic-super-dataset 数据集图片
构建方式
该数据集是针对萨莱基语(Saraiki)构建的综合性语言资源,其构建过程融合了多维度语言学标注与精细的方言学记录。数据集的每条样本均包含原始文本、分词、词元、词性标注、形态学特征、命名实体识别标签、依存句法关系、多词表达式标记以及语义角色和共指消解等丰富信息,形成了一个高度结构化的语言数据体系。在构建时,数据采集覆盖了不同的方言变体,并标注了宏观方言、地方变体、方言区域及方言置信度,同时记录了语码转换情况、矩阵语言及令牌级语言归属。此外,数据集还包含了语域、语言、文字、来源类型、生成模型及提示版本等元数据,且每条样本均经过研究验证与人工核实,附有验证分数。整体构建方式体现了从文本采集到多层级语言学注释的全流程精细化处理。
特点
该数据集的核心特色在于其极致的语言学深度与多维度标注的融合。它不仅提供了基础的词性标注和依存句法,还引入了全套形态学特征、语义角色标注和共指消解链,为计算语言学研究提供了全面的语料支持。同时,其方言学维度尤为突出,囊括了方言变体、区域归属和置信度评估,能有效支撑方言识别和方言学研究。每个样本的语码转换状态、矩阵语言和令牌级语言分布进一步增强了数据集对多语码混合场景的实用价值。通过设置生成模型与提示版本字段,数据集清晰地追踪了语料的生成来源,加之研究依据和验证标识,保障了数据的可靠性和可追溯性。这些特性使该数据集在低资源语言自然语言处理领域独树一帜。
使用方法
使用该数据集时,研究者可直接加载HuggingFace上的默认配置,其训练集包含7个样本,以JSON格式存储,各字段通过列表和结构体组织,便于进行细粒度特征提取。对于信息抽取任务,可利用ner_tags字段;句法分析可结合dependency_heads与dependency_relations;语义解析则依靠semantic_roles和coreference结构。方言相关研究可依据macro_dialect、local_variety及dialect_region字段进行分组与比较。此外,通过generation_model、prompt_version和verified字段,用户可筛选出符合特定生成条件或经过验证的样本,以适配不同的实验要求。由于数据集采用cc-by-nc-4.0许可,使用者需注意非商业用途限制。
背景与挑战
背景概述
saraiki-linguistic-super-dataset 数据集诞生于低资源语言自然语言处理(NLP)研究蓬勃发展的背景下,由致力于南亚语言数字化保存的研究团队于2023年构建。该数据集聚焦于巴基斯坦旁遮普省南部使用的萨莱基语(Saraiki),旨在填补该语言在词法、句法、语义及方言变体等维度上的资源空白。其核心研究问题是如何为一种缺乏标准书写体系和标注工具的语言,构建一个全面的、多层级标注的语料库,以支持机器翻译、方言识别、跨语言信息检索等下游任务。该数据集通过融合人工验证与生成模型辅助标注,首次为萨莱基语提供了包含词性、依存关系、命名实体、语义角色、共指消解及方言信息的高质量标注,显著推动了南亚区域语言技术的研究进程,并为类似低资源语言的资源建设树立了范例,具有重要的学术价值和应用潜力。
当前挑战
该数据集面临的核心挑战源于语言自身的复杂性和资源稀缺性。萨莱基语作为印度-雅利安语支的成员,其音韵、形态和句法结构具有独特性,加之缺乏统一的书写规范和标准化标注准则,导致数据采集与标注过程异常艰难,需依赖语言专家与社区合作。构建过程中,团队遭遇了多重障碍:标注体系需从零设计,以覆盖丰富的屈折形态和复杂的方言连续体;为保证标注一致性,须对生成模型进行精细调优并引入多轮人工审核,但训练样本仅有7条,难以支撑模型学习;同时,语料来源多样,包含文本、语音转写等,需统一处理编码转换和噪声清洗。此外,方言变体众多且界限模糊,导致宏观方言与地方变体的标注主观性强,需谨慎界定。数据量极小还引发了过拟合和泛化能力不足的担忧,限制了其在大规模任务中的应用。
常用场景
经典使用场景
该数据集作为莎莱基语(Saraiki)自然语言处理研究的基石性资源,其经典使用场景聚焦于低资源语言的深度语言学解析。研究者在构建多层级语言标注体系时,可依托其丰富的token、词元、词性、形态、句法依赖、语义角色及指代消解等注释,开展语法结构剖析、语义角色标注和核心指代链识别等任务,从而推动该语言在计算语言学领域的系统化研究。
实际应用
在实际应用层面,该数据集可转化为服务于莎莱基语社区的智能化工具原型,包括但不限于语法纠错系统、教育辅助软件以及交互式语言学习平台。凭借其包含的方言区域、语域及语码切换标签,开发者能够定制适应地方特色的文本处理应用,如自动方言类型识别、新闻分类与舆情监测,从而促进该语言在数字世界中的可见性与可用性。
衍生相关工作
围绕该数据集,可衍生出一系列开创性的研究脉络。其一,基于其深度注释,可构建莎莱基语的第一代依存树库和语义角色标注资源,进而支撑句法分析器与语义理解模型的训练。其二,其方言与语码切换标注可激发跨语言迁移学习研究,探索利用相近的旁遮普语或乌尔都语资源来增强莎莱基语模型的性能。其三,该数据集作为评估基准,可催生低资源多任务学习框架的对比研究,推动针对复杂形态与灵活语序的语言建模新方法,为整个南亚低资源语言群的计算研究提供范式参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务