遇见数据集

tunisian-nlp-resources

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

该数据集是一个经过访问验证的突尼斯阿拉伯语(Derja)NLP 资源清单,收录了包括数据集、语音语料、模型和基准测试在内的多种资源。每个资源都标注了其可获取性状态,如开放获取、需请求、付费、仅论文、门控、商业等。数据集以 CSV 格式提供,包含 108 行记录,其中 100 个为单独标记的资源,7 个为分组条目(组内各子项访问状态不同,标记为“varies (grouped entry)”),1 个为纯交叉引用。数据字段包括:编号(id)、资源名称(name)、类型(text / speech / model)、类别(category,如情感分析、方言识别、语音识别等)、访问状态(access)、一句话描述(description)、规范链接(url)和来源文件(file)。该数据集旨在帮助研究人员快速了解突尼斯阿拉伯语 NLP 资源的可用性,适用于低资源语言研究、资源调查、NLP 工具开发等场景。注意:该数据集仅为资源索引,不包含实际数据;访问状态由人工核实,可能随时间变化。权威版本维护在 GitHub 上,此 CSV 为查询和过滤的辅助视图。

This dataset is an access-verified inventory of Tunisian Arabic (Derja) NLP resources, including datasets, speech corpora, models, and benchmarks. Each resource is annotated with its accessibility status, such as open access, request required, paid, paper-only, gated, commercial, etc. The dataset is provided in CSV format, containing 108 rows, of which 100 are individually labeled resources, 7 are grouped entries (with varying access statuses marked as varies (grouped entry)), and 1 is a pure cross-reference. Data fields include: id, name, type (text/speech/model), category (e.g., sentiment analysis, dialect identification, speech recognition, etc.), access status, description, canonical URL, and source file. The dataset aims to help researchers quickly understand the availability of Tunisian Arabic NLP resources, suitable for low-resource language research, resource surveys, NLP tool development, etc. Note: This dataset is only a resource index and does not contain actual data; access statuses are verified manually and may change over time. The authoritative version is maintained on GitHub, and this CSV is an auxiliary view for querying and filtering.

创建时间:
2026-08-03
原始信息汇总

突尼斯阿拉伯语(Derja)NLP 资源数据集

数据集概览

本数据集是一个经过访问验证的突尼斯阿拉伯语自然语言处理资源清单,覆盖数据集、语音语料库、模型和基准测试。每条资源均经过人工核查,标注其实际可获取性(开放获取、需申请、付费、仅论文等形式)。

基本信息

  • 许可证: CC-BY-4.0
  • 语言: 突尼斯阿拉伯语(aeb)、阿拉伯语(ar)
  • 名称: Tunisian Arabic (Derja) NLP Resources
  • 资源规模: n<1K(共108行数据)
  • 数据文件: resources.csv

内容构成

数据集包含 108 行记录,具体可分为:

  • 100 个独立标注的资源条目
  • 7 个分组条目(标注为 varies (grouped entry),子项访问状态不同)
  • 1 个纯交叉引用(无自身访问状态)

完整 GitHub 清单共包含 138 个标题(含研究人员和实验室)。多方言资源仅记录其中突尼斯阿拉伯语部分,而非整份资源。

数据列说明

  • id: 行号
  • name: 资源名称
  • type: 文本/语音/模型
  • category: 资源类别(情感分析、方言识别、自动语音识别等)
  • access: 访问状态(开放/需申请/付费/仅论文/受限/商业/分组/未标记)
  • description: 一行摘要
  • url: 资源的权威链接
  • file: 来源清单文件

数据用途与限制

  • 本数据集仅索引资源,不重新分发资源本身。
  • 访问状态为人工核实,链接可能存在失效风险。
  • 对不确定的突尼斯方言覆盖情况加以标注而非剔除;经核查不含突尼斯方言数据的资源在 GitHub 上以“确认负面”记录,而非直接省略。
  • CSV 是 Markdown 清单的有损投影
    • 分组条目的个别子项访问状态仅存在于 Markdown 原文中(其中一个受限资源因此未体现为独立值)
    • 少数资源因跨类别交叉引用而出现两次

权威来源

  • GitHub 维护仓库: https://github.com/jjlalli/Tunisian-Derja-NLP-Resources (权威版本,通过 issue 表单接收修正和补充)
  • Hugging Face 镜像: 由 build-dataset-csv.py 从上述仓库自动再生

引用方式

数据集已通过 Zenodo 存档并分配 DOI(概念 DOI,始终解析到最新版本):

bibtex @dataset{jlali_tunisian_nlp_resources, author = {Jlali, Fatma}, title = {Tunisian Arabic NLP Resources: an access-verified inventory}, publisher = {Zenodo}, doi = {10.5281/zenodo.21779464}, url = {https://doi.org/10.5281/zenodo.21779464} }

搜集汇总
数据集介绍
tunisian-nlp-resources 数据集图片
构建方式
该数据集是针对突尼斯阿拉伯语(Derja)这一低资源语言所构建的NLP资源清单,其构建过程严谨而细致。研究者从GitHub上的权威Markdown清单出发,通过人工逐项核验,对每个资源的可获取性进行了分类,包括开放、申请、付费、仅论文等状态。数据集以CSV格式导出,共包含108行数据,每行代表一个资源条目,并记录了资源名称、类型、类别、访问状态、描述及链接等关键信息。对于多方言资源,特别标注了其中的突尼斯语部分,而非笼统计数。构建过程中还包含了交叉引用和分组条目,确保了信息的全面性和准确性。
特点
该数据集的核心特点在于其访问验证的独特性和对低资源语言的深入关注。它不仅列出了资源清单,更通过人工核验标注了每个资源的实际可获取状态,为研究者提供了极具实用价值的参考。数据集覆盖了文本、语音和模型等多种类型,按情感分析、方言识别、语音识别等类别进行组织,便于检索。其构建方式透明,与GitHub上的权威清单保持同步,并提供了DOI引用,确保了数据的可追溯性。尤为重要的是,数据集明确标注了不确定的条目和已确认的负样本,这种严谨的态度在同类数据集中颇为罕见。
使用方法
该数据集的使用极为便捷,用户可通过HuggingFace的`load_dataset`函数直接加载。加载后的数据表支持按列筛选和查询,例如按资源类型、类别或访问状态进行过滤,从而快速定位所需的NLP资源。尽管数据表是Markdown清单的压缩投影,存在一定的信息丢失,但它为研究者提供了一个高效的查询和筛选工具。对于需要详细了解分组条目或个别资源状态的研究者,可进一步查阅GitHub上的权威Markdown清单。数据集还提供了Zenodo DOI,便于在学术工作中正确引用其来源。
背景与挑战
背景概述
在阿拉伯语自然语言处理领域,方言多样性构成了显著的研究壁垒,其中突尼斯阿拉伯语(又称Derja)作为马格里布地区的重要方言,长期处于资源匮乏状态。该数据集的创建者Fatma Jlali于近期构建了这一经过访问验证的资源清单,旨在系统性地整理并评估突尼斯阿拉伯语相关的数据集、语音语料库、模型及基准测试的可获取性。该清单收录了108项资源,涵盖文本、语音及模型类别,并细致区分了开放获取、按需提供、付费墙限制及仅存于论文中等不同访问级别。其核心研究问题聚焦于资源可得性这一关键瓶颈,突破了以往仅罗列资源名称的局限,为低资源方言研究提供了可操作性的导航工具。该工作通过GitHub维护及Zenodo存档,不仅填补了突尼斯阿拉伯语资源目录的空白,也为其他低资源方言的资源整合提供了方法论参考,对推动该领域的研究可复现性与国际化合作具有显著影响力。
当前挑战
该数据集所应对的挑战具有双重性。首先,在领域层面,突尼斯阿拉伯语作为低资源方言,其研究长期受制于数据稀缺、标注不一致及资源分散等问题;现有资源往往隐藏于论文附录或私有存储中,缺乏统一的访问途径和可用性验证,导致研究难以复现与比较。该清单通过人工验证并明确标注访问状态(如开放、按需、付费墙等),有效缓解了资源发现与获取的障碍。其次,在构建过程中,挑战同样严峻。资源来源多样且链接易失效,需逐项人工核查,并应对资源分组中访问状态不一的情况;为了忠实反映复杂性,清单以Markdown为权威版本,而导出的CSV文件作为有损投影,需妥善处理分组条目、交叉引用及状态缺失等细节。此外,对于确认不含突尼斯阿拉伯语数据的资源,清单采用“Confirmed negatives”方式记录,以避免误导,进一步考验了数据组织的精细度与严谨性。
常用场景
经典使用场景
作为低资源语言自然语言处理领域的一项基础性资源,该数据集以结构化清单形式系统收录了突尼斯阿拉伯语(Derja)的语料库、语音数据、模型与基准测试,共计108项条目,涵盖文本、语音、模型等类型,并标注了每项资源的可获取性(开放、按需、付费等)。其经典使用场景在于为研究者提供一站式的资源检索与筛选入口,便于快速定位特定任务(如情感分析、方言识别、语音识别)的可用数据集或模型,从而显著降低调研成本,推动该方言NLP研究的起步与深化。
解决学术问题
该数据集直面低资源语言NLP研究中长期存在的资源分散、访问状态不明、可用性存疑等痛点。通过人工逐项验证资源的实际可获取性,并明确区分开放、按需、付费、仅论文等状态,有效解决了研究者因信息不对称而重复造轮子或误用不可获取资源的问题。其意义在于为突尼斯阿拉伯语NLP建立了一个透明、可追溯的资源基础设施,促进研究可复现性,并激励社区贡献与资源整合,对低资源语言研究具有范式参考价值。
衍生相关工作
该数据集衍生的相关工作集中在资源追踪与标准化领域。其GitHub仓库维护的Markdown总清单成为权威版本,并配套自动生成CSV的脚本,为其他低资源语言(如马格里布方言)的资源目录构建提供了可复用的方法论。此外,其明确的访问状态标注机制催生了关于NLP资源可获取性评估的研究,并可能引发后续对资源自动更新、生命周期管理及跨方言资源整合的探索。该数据集本身也已被引用为突尼斯阿拉伯语NLP研究的重要起点,支撑了多项基于该清单进行的实证分析。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务