遇见数据集

ghana-corpus

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

Ghana Corpus是一个多语言平行语料数据集,专门针对加纳本土语言及多种世界语言构建。该数据集的核心内容来源于公开的圣经翻译文本(取自YouVersion),并按照经文节进行精确对齐,使得任意两种语言之间均可形成平行语料对。数据集包含多种加纳语言(如Twi、Ewe、Gaa、Dag、Fante、Adangme、Gonja、Dagaare、Nzema、Abron)以及英语、法语、西班牙语、葡萄牙语、德语、意大利语、阿拉伯语、中文和斯瓦希里语。数据以CSV文件格式组织,分为三个配置视图:ghanaian配置包含加纳语言文件,字段包括verse_key(经文键)、version_id(版本ID)、eng(英语文本)和local(本地语言文本);english配置为英语缓存文件,包含verse_key和eng字段;reference配置为参考缓存文件,包含verse_key、version_id、lang_code(语言代码)和text(文本)字段。所有文件通过共享的verse_key列实现跨语言对齐,支持构建加纳语↔英语、加纳语↔加纳语、加纳语↔其他语言的双语平行语料库,也可用于构建任何单一语言的单语语料库。该数据集旨在支持机器翻译、文本生成等自然语言处理任务,尤其适用于低资源语言的研究与应用。数据集由Ghana NLP社区构建,鼓励在使用时引用该社区并注明底层圣经翻译来源。

Ghana Corpus is a multilingual parallel corpus dataset specifically designed for Ghanaian local languages and various world languages. The core content of this dataset is derived from publicly available Bible translation texts (taken from YouVersion) and is precisely aligned by verse, enabling parallel corpus pairs between any two languages. The dataset includes multiple Ghanaian languages (such as Twi, Ewe, Gaa, Dag, Fante, Adangme, Gonja, Dagaare, Nzema, Abron) as well as English, French, Spanish, Portuguese, German, Italian, Arabic, Chinese, and Swahili. The data is organized in CSV file format, divided into three configuration views: the ghanaian configuration includes Ghanaian language files with fields such as verse_key (verse key), version_id (version ID), eng (English text), and local (local language text); the english configuration is an English cache file containing verse_key and eng fields; the reference configuration is a reference cache file containing verse_key, version_id, lang_code (language code), and text fields. All files are aligned across languages through the shared verse_key column, supporting the construction of bilingual parallel corpora (e.g., Ghanaian ↔ English, Ghanaian ↔ Ghanaian, Ghanaian ↔ other languages) and monolingual corpora for any single language. This dataset aims to support natural language processing tasks such as machine translation and text generation, particularly for low-resource language research and applications. The dataset is built by the Ghana NLP community, and users are encouraged to cite the community and acknowledge the underlying Bible translation sources when using it.

创建时间:
2026-06-18
原始信息汇总

Ghana Corpus 数据集概述

基本信息

  • 数据集名称:Ghana Corpus
  • 许可证:other(需遵守 YouVersion 服务条款)
  • 语言:覆盖加纳本地语言(Twi、Ewe、Gaa、Dag、Fat、Ada、Gjn、Kdh、Nzi、Abr)及世界语言(英语、法语、西班牙语、葡萄牙语、德语、意大利语、阿拉伯语、中文、斯瓦希里语)
  • 任务类别:翻译、文本生成
  • 多语言性质:多语言、翻译
  • 标签:加纳、加纳语言、低资源、平行语料、机器翻译、圣经

数据集结构

数据集基于圣经译本构建,所有语言通过共享的 verse_key(如 JHN.3.16)进行对齐。包含三个配置:

配置 文件模式
ghanaian {Language}_{code}_v{id}.csv verse_key, version_id, eng, local
english english_cache.csv verse_key, eng
reference reference_caches/{Language}_{code}_v{id}.csv verse_key, version_id, lang_code, text

主要用途

  • 平行语料:任意两种语言可通过 verse_key 对齐为平行语料
    • 加纳语 ↔ 英语(默认配对)
    • 加纳语 ↔ 加纳语(如 Twi ↔ Ewe)
    • 加纳语 ↔ 其他世界语言(法语、西班牙语等)
  • 单语语料:可用于任何单一语言的文本生成任务

使用方式

推荐方式:通过 Ghana Corpus Builder 库

bash git clone https://github.com/GhanaNLP/ghana-corpus-builder.git cd ghana-corpus-builder

Twi ↔ 英语

python ghana_corpus.py --source twi

Twi ↔ Ewe,随机抽取5000对样本

python ghana_corpus.py --source twi --target ewe --limit 5000 --sample

单语 Twi

python ghana_corpus.py --source twi --monolingual

列出所有可用语言

python ghana_corpus.py --list

直接加载 CSV

python from huggingface_hub import hf_hub_download import pandas as pd path = hf_hub_download("ghananlpcommunity/ghana-corpus", "Ewe_ewe_v1613.csv", repo_type="dataset") df = pd.read_csv(path)

数据来源与许可

  • 来源:公开的圣经译本,来自 YouVersion
  • 引用:若用于研究,请引用 Ghana NLP Community 并致谢圣经翻译来源
  • 代码许可:MIT 许可证(详见 GitHub 仓库)

语言识别

  • reference 配置包含 lang_code 列直接标识语言
  • 加纳语行的 version_id 可通过 youversion_ghana_versions.csv 映射到具体语言(文件地址:https://github.com/GhanaNLP/ghana-corpus-builder/blob/main/youversion_ghana_versions.csv)
搜集汇总
数据集介绍
ghana-corpus 数据集图片
构建方式
该数据集源自加纳本土语言及多种世界语言的圣经译本,通过从YouVersion平台获取公开的圣经文本,并以诗句级别(verse-key)作为对齐基准构建而成。每一条记录均共享统一的诗句标识符(如JHN.3.16),从而支持任意两种语言之间的平行语料拼接。数据以CSV格式存储,文件命名规则清晰,包含语言名称、语言代码及圣经版本编号,便于自动识别与解析。此外,数据集被划分为加纳语、英语和参考语三种配置,分别对应不同的字段结构,其中参考语配置额外携带语言代码列,以增强跨语言的可追溯性。
使用方法
推荐用户通过专用的Ghana Corpus Builder工具库来高效使用该数据集,该工具可自动下载所需文件并进行语料拼接。用户只需指定源语言与目标语言代码,即可生成平行语料;亦可通过添加参数获取单语数据或随机采样指定规模的对齐对。对于直接操作数据的需求,用户也可通过Hugging Face Hub下载单个CSV文件,并利用Pandas等库进行加载与处理。数据集默认支持加纳语与英语的配对,但凭借诗句键的通用性,任意两种语言之间的转换均可轻松实现。
背景与挑战
背景概述
在自然语言处理领域,低资源语言机器翻译长期面临数据稀缺的困境,尤其对于加纳境内诸多本土语言,如契维语、埃维语、加语等,因缺乏大规模、高质量的平行语料,相关研究进展缓慢。为打破这一桎梏,加纳自然语言处理社区(Ghana NLP Community)于近年创建了Ghana Corpus数据集,该数据集以圣经文本为对齐基础,构建了涵盖加纳本土语言及英语、法语、西班牙语、阿拉伯语等十余种全球语言的篇章级平行语料。通过统一的经文关键词(verse_key)实现任意语言组合的对齐,为低资源机器翻译、多语言文本生成等任务提供了坚实的数据基础。该数据集的发布,显著推动了非洲本土语言在自然语言处理领域的研究,成为连接加纳语言与世界语言的重要桥梁。
当前挑战
Ghana Corpus所面临的挑战是多维度的。在领域问题层面,低资源机器翻译的核心难点在于语料极度匮乏,加盖纳本土语言多为低资源语言,缺乏大规模标注数据,且语言之间形态、语法差异显著,如契维语与埃维语属于不同语系,直接对齐翻译难度极高。在构建过程中,数据集依赖圣经翻译版本,其文本内容具有宗教领域特异性,可能限制模型在通用场景下的泛化能力;同时,不同圣经版本的语言版本号、对齐粒度存在差异,需通过额外的映射表(如youversion_ghana_versions.csv)进行规范化处理,增加了数据清洗与对齐的复杂性。此外,版权条款的约束要求使用者审慎审视协议条款,限制了数据集的自由分发与商业应用潜力。
常用场景
经典使用场景
Ghana Corpus数据集的核心价值在于为加纳本土低资源语言(如契维语、埃维语、加语等)与英语及其他世界语言之间构建平行语料库。该数据集以圣经经节为对齐锚点,提供了跨语言、跨版本的高度结构化文本,广泛应用于机器翻译系统的训练与评估。研究人员可基于数据集的统一verse_key键值,灵活选取任意语言对,构建双语或多语平行语料,亦可抽取单语数据用于语言建模或文本生成任务。其设计精巧,极大简化了低资源语言场景下的数据准备流程,成为加纳语言自然语言处理研究的基石性资源。
解决学术问题
该数据集解决了低资源语言机器翻译领域最棘手的瓶颈——高质量平行语料的匮乏。加纳境内使用超过50种语言,其中绝大多数缺乏足够的数字化文本资源和标注数据,导致相关自然语言处理研究长期停滞。Ghana Corpus通过系统化整理公开的圣经译本,生成了覆盖11种加纳语言及8种世界语言的百万级对齐语料,填补了这一空白。此项工作不仅为低资源神经机器翻译提供了可靠的数据支撑,也为跨语言迁移学习、多语言预训练模型的评测提供了标准化基准,推动了非洲语言在计算语言学中的学术地位。
实际应用
在实际应用中,Ghana Corpus直接服务于加纳及西非地区的多语言信息平等化事业。基于该语料库训练出的机器翻译系统被集成至社区信息服务、农业知识传播、公共卫生宣导等场景,帮助非英语母语的加纳民众获取关键信息。此外,该数据集支持构建方言感知的语音助手和文本输入工具,促进数字包容性。对于开发跨国文化交流平台和联合国教科文组织的语言保护项目,该数据集也提供了可迁移的技术范式,已被多家国际NGO和本国科技团队采纳为底层语言资源。
数据集最近研究
最新研究方向
在低资源多语言机器翻译研究浪潮中,加纳语料库作为汇聚十余种加纳本土语言与全球主流语言的诗节级平行语料,正成为破解非洲低资源语言神经翻译难题的关键数据基础设施。最新研究方向聚焦于利用该语料库的跨语言对齐特性,探索基于共享经文键的语料高效组织范式,以支撑极低资源语言对的零样本翻译与多语联合建模。同时,研究界正借助其圣经文本的高质量诗节映射,推动方言级翻译微调、基于语言族谱系的知识蒸馏以及跨语言预训练模型在非洲语系中的适配评估,这些前沿探索不仅拓展了机器翻译的地域纵深,更为全球语言技术普惠提供了可复现的低资源解决方案范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务