遇见数据集

africa-corpus

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

Africa Corpus是一个大规模多语言平行语料库,旨在为机器翻译和文本生成等任务提供高质量的训练数据。该数据集基于公共圣经翻译构建,核心特点是经文级别的精确对齐。它覆盖了792种以上的非洲语言(涵盖尼日尔-刚果语系、亚非语系、尼罗-撒哈拉语系、科伊桑语系和南岛语系等主要非洲语言家族),以及英语、法语、阿拉伯语、中文、葡萄牙语等多种世界语言。所有语言通过共享的经文键(如JHN.3.16)对齐,支持任意两种语言组合成平行语料对(如非洲语言↔英语、非洲语言↔非洲语言、非洲语言↔其他语言),也可用于构建单语料库。数据集包含约1,090个圣经版本,总计约1,600万条经文记录。数据以CSV文件格式组织,分为三个配置:african_languages配置包含各非洲语言的经文文本(列:verse_key, version_id, local);english配置包含英语参考文本(列:verse_key, eng);reference_caches配置包含其他参考语言的缓存文本(列:verse_key, version_id, lang_code, text)。主要适用于低资源语言机器翻译、多语言NLP模型训练、语言学研究等场景。数据来源于YouVersion的圣经翻译,使用时需遵守其服务条款。

The Africa Corpus is a large-scale multilingual parallel corpus designed to provide high-quality training data for tasks such as machine translation and text generation. It is built on public Bible translations, with a core feature of verse-level alignment. The dataset covers over 792 African languages (spanning major language families including Niger-Congo, Afro-Asiatic, Nilo-Saharan, Khoisan, and Austronesian) as well as world languages such as English, French, Arabic, Chinese, and Portuguese. All languages are precisely aligned via shared verse keys (e.g., JHN.3.16), enabling easy combination of any two languages into parallel corpus pairs (e.g., African language ↔ English, African language ↔ African language, African language ↔ other languages) and also supporting the construction of monolingual corpora. The dataset contains approximately 1,090 Bible versions, totaling about 16 million verse records. Data is organized in CSV format with three configurations: the african_languages configuration includes verse texts in African languages (columns: verse_key, version_id, local); the english configuration includes English reference texts (columns: verse_key, eng); and the reference_caches configuration includes cached texts for other reference languages (columns: verse_key, version_id, lang_code, text). It is primarily suitable for low-resource language machine translation, multilingual NLP model training, and linguistic research. The data originates from YouVersions Bible translations, and users must comply with its terms of service.

创建时间:
2026-06-18
原始信息汇总

数据集概述:Africa Corpus

Africa Corpus 是一个面向非洲语言的端到端对齐语料库,包含 792+ 种非洲语言及多种世界语言,支持构建平行语料单语语料。所有语言均基于共享的 verse_key(如 JHN.3.16)对齐,因此任意两种语言均可拼接为平行语料。

主要特性

  • 多语言对齐:除非洲语言外,还提供英语、法语、阿拉伯语、中文、葡萄牙语作为平行目标语言。
  • 语料组合灵活
    • 非洲语言 ↔ 英语(默认配对)
    • 非洲语言 ↔ 非洲语言(如Twi ↔ Yoruba)
    • 非洲语言 ↔ 其他世界语言
    • 任意单一语言的单语语料
  • 数据格式:基于CSV文件,每行包含 verse_keyversion_idlocal(或 engtext 等)列。

数据规模与覆盖

  • 圣经版本:1,090 个
  • 语言覆盖:792+ 种非洲语言,涵盖主要语系(尼日尔-刚果语系、亚非语系、尼罗-撒哈拉语系、科伊桑语系、南岛语系(马达加斯加))。
  • 总记录数:约 1,600 万节经文。

数据结构

数据集分为三个视图配置,分别对应不同文件组:

配置 文件模式
african_languages {Language}_{code}_v{id}.csv verse_key, version_id, local
english english_cache.csv verse_key, eng
reference_caches reference_caches/{Language}_{code}_v{id}.csv verse_key, version_id, lang_code, text

所有文件通过 verse_key 列对齐,文件名本身编码了语言名称、代码和圣经版本ID。

使用方法

推荐使用专用的 Africa Corpus Builder 库(GitHub仓库:michsethowusu/africa-corpus-builder)来下载和拼接所需数据:

bash pip install huggingface_hub git clone https://github.com/michsethowusu/africa-corpus-builder.git cd africa-corpus-builder

示例:Swahili ↔ English

python africa_corpus.py --source swc

示例:Twi ↔ Yoruba,随机抽取 5,000 对

python africa_corpus.py --source twi --target yor --limit 5000 --sample

示例:单语 Hausa

python africa_corpus.py --source hau --monolingual

列出所有可用语言

python africa_corpus.py --list

也可直接加载原始CSV文件:

python from huggingface_hub import hf_hub_download import pandas as pd

path = hf_hub_download("michsethowusu/africa-corpus", "Swahili_swc_v74.csv", repo_type="dataset") df = pd.read_csv(path)

许可与来源

  • 文本来源:公共领域的 圣经译本,来自 YouVersion。使用时需遵守 YouVersion 的服务条款。
  • 代码许可:MIT 许可证(详见 GitHub 仓库)。
  • 引用建议:若在研究中使用了本数据,请引用所涉及的圣经翻译来源。
搜集汇总
数据集介绍
africa-corpus 数据集图片
构建方式
Africa Corpus 由来自 YouVersion 的公开圣经译本构建而成,覆盖 792 余种非洲语言及多种世界语言。数据以诗句级对齐为基础,每个语言版本均以包含语言名称、代码和版本标识的 CSV 文件存储,并通过共享的 verse_key 字段实现任意两种语言间的平行对齐。该语料库共计收录约 1600 万条诗句记录,支持构建平行语料与单语语料。
特点
该数据集的核心特色在于其卓越的多语言对齐能力,允许用户自由组合非洲语言之间、非洲语言与英语、法语、阿拉伯语、中文及葡萄牙语等参考语言的平行语料。覆盖尼日尔-刚果、亚非语系、尼罗-撒哈拉、科伊桑及南岛语系等主要非洲语言家族。数据集通过 Africa Corpus Builder 库实现按需下载与灵活采样,极大降低了低资源语言机器翻译研究的门槛。
使用方法
数据集推荐通过 Africa Corpus Builder 工具使用,用户可指定源语言和目标语言,并设置采样数量与随机抽样方式,快速生成平行语料。亦可直接通过 Hugging Face Hub 下载特定语言的 CSV 文件,利用 pandas 等库进行加载。对于简单场景,用户还可列出所有可用语言,或仅提取单语语料,满足多样化研究需求。
背景与挑战
背景概述
非洲大陆拥有超过2000种语言,是全球语言多样性最为丰富的地区之一,然而绝大多数非洲语言在自然语言处理领域属于低资源语言,严重制约了相关研究的开展。Africa Corpus数据集由Mich Seth Owusu等人于近年创建,旨在缓解非洲语言在机器翻译和文本生成等任务中的数据匮乏问题。该数据集基于YouVersion平台公开的圣经翻译资源,精心对齐了792种以上非洲语言与英语、法语、阿拉伯语等世界语言的平行语料,覆盖尼日尔-刚果、亚非语系、尼罗-撒哈拉等多个主要语系,共包含约1600万条诗句级对齐记录。这一大规模、多语种的对齐语料为非洲语言的自然语言处理研究提供了宝贵的基石,显著推动了低资源语言的机器翻译、跨语言迁移学习及语料库语言学的发展,并已成为非洲NLP社区的重要基础设施。
当前挑战
Africa Corpus数据集所解决的领域核心挑战在于非洲语言的低资源困境,即缺乏大规模、高质量、多语种的平行语料,致使机器翻译系统在这些语言上表现不佳,难以实现与资源丰富语言同等的性能。在构建过程中,主要挑战包括:其一,数据来源仅限于圣经翻译文本,语言风格和领域高度单一,难以覆盖日常对话、新闻、科技等多样化场景,可能引入领域偏差;其二,诗句级对齐虽然确保了并行性,但不同版本间的翻译风格和术语差异较大,对齐精度和一致性需要精细校验;其三,依赖YouVersion等第三方平台的公开数据,版权与再分发受其服务条款约束,增加了数据使用的法律风险。此外,维持近800种语言的数据持续更新和质量控制也是一项艰巨的系统工程。
常用场景
经典使用场景
Africa Corpus数据集的核心用途在于构建面向超低资源非洲语言的平行语料库与单语语料库。其独特之处在于所有语种均以共享的经文节号为对齐锚点,允许研究人员灵活地组合任意两种语言形成平行翻译对,例如非洲语言与英语的经典组合,或是非洲本土语言之间的直接对齐,如契维语与约鲁巴语。此外,该数据集亦支持单语文本提取,为语言模型预训练提供扎实的语料基础。借助配套的Africa Corpus Builder工具库,用户可按需下载特定语言子集并自动完成对齐,极大降低了低资源语言数据准备的门槛,从而成为机器翻译、跨语言信息检索及多语言自然语言处理研究的基石资源。
衍生相关工作
Africa Corpus衍生了若干具有影响力的相关工作。其设计理念承袭自Ghana NLP社区开发的ghana-corpus-builder,并在此基础上进行了大幅扩展,覆盖了整个非洲大陆的语言多样性。研究者可基于此数据集进行多语言机器翻译系统的基准测试,例如探索基于共享子词嵌入的跨语言迁移方法。此外,该数据集促进了针对非洲语言的预训练语言模型研究,如利用其单语语料微调多语言BERT或训练新的小规模语言模型。后续工作还包括使用其对经文对齐质量进行语言学分析,以及开发自动化的语料扩展工具,将圣经翻译数据与网络爬虫语料结合,进一步丰富低频语言的资源库。
数据集最近研究
最新研究方向
Africa Corpus汇聚了792种非洲语言的约1600万行平行语料,以诗节键为锚点实现任意语言对的精细对齐,为低资源神经机器翻译与跨语言文本生成提供了前所未有的数据基础。这一语料库的建构,恰逢多语言AI模型在非洲大陆落地应用的关键节点——例如非洲大陆自贸区多语言贸易文档的自动翻译、撒哈拉以南地区教育资源的本地化适配,以及斯瓦希里语与豪萨语等区域性通用语的数字治理建设。通过与非洲NLP社群合作,该数据集将圣经文本这一高结构化的翻译资源转化为可复用的平行语料框架,显著降低了非洲语言在机器翻译基准测试中的数据稀缺瓶颈。其影响不仅体现在模型性能的提升上,更在于为保护语言多样性、推动数字包容性提供了可操作的数据基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务