遇见数据集

aremuadeolajr/NaijaRC

收藏
Hugging Face2024-05-07 更新2024-05-25 收录
官方服务:

资源简介:

--- license: cc-by-nc-4.0 language: - ig - yo - ha size_categories: - n<1K multilinguality: - multilingual pretty_name: NaijaRC language_details: ibo, yor, hau tags: - naijarc task_categories: - multiple-choice task_ids: - multiple-choice-qa configs: - config_name: ibo data_files: - split: test path: ibo/test.csv - config_name: yor data_files: - split: train path: yor/train.csv - split: validation path: yor/dev.csv - split: test path: yor/test.csv - config_name: hau data_files: - split: test path: hau/test.csv --- # Dataset Card for afrixnli ## Table of Contents - [Table of Contents](#table-of-contents) - [Dataset Description](#dataset-description) - [Dataset Summary](#dataset-summary) - [Languages](#languages) - [Dataset Structure](#dataset-structure) - [Data Instances](#data-instances) - [Data Fields](#data-fields) - [Data Splits](#data-splits) ## Dataset Description - **Point of Contact:** aremuadeola97@gmail.com ### Dataset Summary ### Languages There are 3 languages available : ## Dataset Structure ### Data Instances The examples look like this for English: ``` from datasets import load_dataset data = load_dataset('aremuadeolajr/NaijaRC', 'yor') # Please, specify the language code # A data point example is below: ```

--- 许可证:CC-BY-NC-4.0 语言: - 伊博语(Igbo) - 约鲁巴语(Yoruba) - 豪萨语(Hausa) 样本量类别: - n<1K 多语言特性: - 多语言 展示名称:NaijaRC 语言详情:伊博语、约鲁巴语、豪萨语 标签: - naijarc 任务类别: - 多项选择 任务类型: - 多项选择问答(multiple-choice-qa) 配置项: - 配置名称:ibo 数据文件: - 划分集:测试集,文件路径:ibo/test.csv - 配置名称:yor 数据文件: - 划分集:训练集,文件路径:yor/train.csv - 划分集:验证集,文件路径:yor/dev.csv - 划分集:测试集,文件路径:yor/test.csv - 配置名称:hau 数据文件: - 划分集:测试集,文件路径:hau/test.csv --- # AfriXNLI 数据集卡片 ## 目录 - [目录](#table-of-contents) - [数据集说明](#dataset-description) - [数据集摘要](#dataset-summary) - [语言](#languages) - [数据集结构](#dataset-structure) - [数据样例](#data-instances) - [数据字段](#data-fields) - [数据划分](#data-splits) ## 数据集说明 - **联系人邮箱**:aremuadeola97@gmail.com ### 数据集摘要 ### 语言 可用语言共3种: ## 数据集结构 ### 数据样例 以下为英语格式的数据样例: from datasets import load_dataset data = load_dataset('aremuadeolajr/NaijaRC', 'yor') # 请指定语言代码 # 以下为单个数据点的样例:

提供机构:
aremuadeolajr
原始信息汇总

数据集概述

数据集名称

  • 名称: NaijaRC

许可证

  • 许可证: cc-by-nc-4.0

语言

  • 语言:
    • ig
    • yo
    • ha
  • 详细语言:
    • ibo
    • yor
    • hau

大小分类

  • 大小: n<1K

多语言性

  • 多语言性: 多语言

标签

  • 标签: naijarc

任务类别

  • 任务类别: 多项选择
  • 任务ID: 多项选择-qa

配置

  • 配置名称: ibo
    • 数据文件:
      • 分割: test
        • 路径: ibo/test.csv
  • 配置名称: yor
    • 数据文件:
      • 分割: train
        • 路径: yor/train.csv
      • 分割: validation
        • 路径: yor/dev.csv
      • 分割: test
        • 路径: yor/test.csv
  • 配置名称: hau
    • 数据文件:
      • 分割: test
        • 路径: hau/test.csv
搜集汇总
数据集介绍
aremuadeolajr/NaijaRC 数据集图片
构建方式
NaijaRC数据集聚焦于尼日利亚三大本土语言——伊博语(ibo)、约鲁巴语(yor)和豪萨语(hau),旨在为多语言选择题问答任务提供评估基准。该数据集以语言代码为配置项,分别构建了独立的子集:约鲁巴语子集包含训练集、验证集和测试集,而伊博语与豪萨语子集仅提供测试集。每个子集均以CSV格式存储,确保了数据加载的便捷性与跨语言研究的可复现性。
特点
该数据集的核心特点在于其多语言覆盖与任务专一性,聚焦于低资源尼日利亚语言的机器阅读理解能力评估。通过为每种语言提供独立的配置,研究者能够针对单一语言或跨语言场景进行灵活实验。数据集规模虽小(n<1K),但结构严谨,每个样本均包含标准化的选择题格式,为评估模型在非洲语言上的推理能力提供了可靠的测试床。
使用方法
使用HuggingFace的datasets库可便捷加载该数据集,需通过config_name参数指定目标语言代码,例如'load_dataset("aremuadeolajr/NaijaRC", "yor")'加载约鲁巴语子集。加载后,数据实例以字典形式呈现,包含问题、选项及正确答案等字段。研究者可按需选择特定语言的训练或测试分割,进行模型微调或零样本评估,从而推动多语言NLP在非洲语境下的发展。
背景与挑战
背景概述
NaijaRC数据集由Aremu Adeola等人于近年创建,旨在填补尼日利亚三大本土语言——伊博语(ibo)、约鲁巴语(yor)和豪萨语(hau)在机器阅读理解领域的资源空白。该数据集以多项选择问答为核心任务,覆盖了低资源语言场景下自然语言理解的关键挑战。作为非洲语言处理研究的重要里程碑,NaijaRC为评估和提升多语言模型在尼日利亚语境中的推理能力提供了标准化基准,其发布极大地推动了低资源语言NLP技术的本地化发展,并促进了非洲语言在人工智能领域的学术关注与实践应用。
当前挑战
NaijaRC所解决的领域挑战在于低资源语言机器阅读理解任务的稀缺性——现有主流数据集多聚焦于英语等高资源语言,导致模型在尼日利亚本土语言上表现欠佳。构建过程中,数据收集面临方言多样性、标注人员稀缺及语言规范化不足等困难,例如伊博语和豪萨语缺乏统一的拼写标准,增加了数据清洗与一致性校验的复杂度。此外,测试集规模极小(各语言样本数低于千条),限制了模型泛化能力的可靠评估,反映了低资源场景下数据量与质量平衡的典型瓶颈。
常用场景
经典使用场景
NaijaRC数据集专为尼日利亚三大本土语言——伊博语、约鲁巴语和豪萨语——的多选题问答任务而构建,其经典使用场景聚焦于低资源语言机器阅读理解能力的评估与提升。研究人员可借助该数据集训练模型,在缺乏大规模标注语料的语言环境中,从给定文本中精准定位并提取答案,从而推动多语言自然语言处理技术在非洲地区的纵深发展。
衍生相关工作
该数据集衍生了一系列开创性工作,包括针对低资源语言设计的跨语言预训练模型(如AfriBERTa、mT5在尼日利亚语上的微调),以及结合迁移学习与数据增强技术的鲁棒问答框架。相关研究还探索了多任务联合训练方法,将NaijaRC与命名实体识别、情感分析等任务结合,验证了其在多语言理解中的泛化能力。
数据集最近研究
最新研究方向
随着非洲本土语言在自然语言处理领域的关注度日益提升,NaijaRC数据集应运而生,聚焦于尼日利亚三大主要语言——伊博语、约鲁巴语和豪萨语的机器阅读理解任务。该数据集以多项选择问答形式构建,填补了低资源语言在复杂语义理解与推理能力评估上的空白。当前前沿研究方向集中于利用跨语言迁移学习与多任务联合训练,提升模型在数据稀疏场景下的泛化性能。此外,结合非洲数字经济发展与本土语言文化保护的热点,NaijaRC为构建更公平、包容的多语言AI系统提供了关键基准,其意义在于推动低资源语言从被边缘化走向主流研究视野,并为非洲大陆的智能教育、信息检索等应用奠定数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务