遇见数据集

ghananlpcommunity/ghana-corpus

收藏
Hugging Face2026-06-18 更新2026-06-21 收录
官方服务:

资源简介:

Ghana Corpus是一个包含加纳语言(如Twi、Ewe、Gaa、Dag、Fanti、Adangme、Gonja、Dagaare、Nzema、Abron等)以及多种世界语言(如英语、法语、西班牙语、葡萄牙语、德语、意大利语、阿拉伯语、中文、斯瓦希里语)的经文对齐文本数据集。该数据集用于构建平行语料库和单语语料库,所有语言通过共享的经文键(例如JHN.3.16)对齐,支持加纳语与英语(英语为默认配对语言)、加纳语之间、加纳语与其他语言的对齐,以及任何单一语言的单语语料库。数据来源于公开的圣经翻译文本,从YouVersion获取,并分为三个配置:ghanaian(包含经文键、版本ID、英语文本和本地语言文本)、english(包含经文键和英语文本)和reference(包含经文键、版本ID、语言代码和文本)。数据集旨在支持低资源语言处理、机器翻译和文本生成任务,由Ghana NLP社区构建。

Ghana Corpus is a verse-aligned text dataset for Ghanaian languages (such as Twi, Ewe, Gaa, Dag, Fanti, Adangme, Gonja, Dagaare, Nzema, Abron) plus several world languages (including English, French, Spanish, Portuguese, German, Italian, Arabic, Chinese, Swahili). It is designed for building parallel and monolingual corpora, with all languages aligned on a shared verse key (e.g., JHN.3.16), enabling Ghanaian ↔ English (default pair), Ghanaian ↔ Ghanaian, Ghanaian ↔ other language alignments, and monolingual corpora for any single language. The text is derived from public Bible translations retrieved from YouVersion, and the dataset is split into three configs: ghanaian (with columns: verse_key, version_id, eng, local), english (verse_key, eng), and reference (verse_key, version_id, lang_code, text). It supports low-resource language processing, machine translation, and text generation tasks, built by the Ghana NLP Community.

提供机构:
ghananlpcommunity
搜集汇总
数据集介绍
ghananlpcommunity/ghana-corpus 数据集图片
构建方式
该数据集基于从YouVersion平台获取的公开圣经译本进行构建,通过精心设计的诗句级对齐方式,实现了加纳本土语言(如Twi、Ewe、Gaa等)与多种世界语言(包括英语、法语、西班牙语、中文等)的平行语料整合。所有语料均以统一的`verse_key`(如`JHN.3.16`)作为对齐锚点,确保任意两种语言之间可以无缝拼接为平行语料库。数据集文件采用自描述命名规则,如`{Language}_{code}_v{id}.csv`,同时提供了三种配置视图(加纳语、英语、参考数据),分别存储不同结构的CSV表格,便于用户按需加载。
特点
该数据集最显著的特征在于其高度灵活的多语言对齐能力:不仅支持加纳语与英语的默认配对,还能实现加纳语之间(如Twi↔Ewe)以及加纳语与法语、阿拉伯语等非英语语言的自由组合,甚至可提取单一语言的单语语料库。数据来源统一且结构化,每个文件均内嵌语言标识和版本信息,参考配置更是直接包含`lang_code`列,极大降低了语言识别的复杂性。作为面向低资源语言的平行语料库,它为机器翻译和文本生成任务提供了珍贵的基础资源,尤其填补了加纳本土语言在NLP领域的空白。
使用方法
推荐用户通过专用的Ghana Corpus Builder库来使用该数据集,该工具可从仓库自动下载所需文件并完成语言对齐工作。用户只需调用`pip install huggingface_hub`并克隆工具库,随后通过`--source`和`--target`参数指定源语言和目标语言,即可快速生成平行语料;支持`--limit`和`--sample`参数控制样本量,`--monolingual`选项提取单语语料。对于进阶用户,亦可直接通过`hf_hub_download`函数下载原始CSV文件,利用Pandas库进行自定义数据处理。
背景与挑战
背景概述
加纳语料库(Ghana Corpus)由加纳自然语言处理社区(Ghana NLP Community)于近年创建,旨在应对低资源语言机器翻译与文本生成领域的核心困境——加纳境内多种本土语言(如契维语、埃维语、加语等)缺乏大规模、高质量的对齐语料。该数据集以圣经译本为锚点,通过统一的诗节键实现了十种加纳语言与英语、法语、中文等十九种世界语言的平行对齐,为跨语言研究提供了结构化基础。其影响力在于突破了低资源语言数据稀缺的瓶颈,推动了西非语言在自然语言处理中的系统性研究,同时为多语言模型训练与迁移学习提供了可复现的基准资源。
当前挑战
该数据集所解决的领域挑战在于低资源语言机器翻译中平行语料匮乏的问题,通过将圣经文本这种有限但结构完整的数据源转化为可用的对齐语料,为缺乏大规模互联网文本的加纳语言提供了可行的初始建模基础。在构建过程中,主要挑战包括:一是从宗教文本中提取的语料存在领域偏差,难以覆盖日常用语与技术术语的多样性;二是多语言版本间的诗节对齐依赖人工标注的版本映射表,需频繁校验以避免错位;三是数据集规模受限于圣经章节总数,单语言样本量通常不足万对,对深层神经网络的训练支撑有限。
常用场景
经典使用场景
Ghana Corpus 数据集专为加纳本土语言与多种世界语言之间的机器翻译研究而构建,其核心应用场景在于提供经节对齐的平行语料库。通过统一的 verse_key 字段,研究者能够灵活地组合任意两种语言,例如 Twi 与 Ewe 之间的跨加纳语言翻译,或加纳语言与英语、法语、中文等语言的双向翻译。同时,该数据集也支持单一语言的文本生成任务,为低资源语言的自然语言处理研究提供了坚实的数据基础。
实际应用
在实际应用中,Ghana Corpus 可用于开发面向加纳本土语言的翻译工具和文本生成系统,例如构建加纳语与英语的实时翻译服务,或为教育、医疗等领域的跨语言沟通提供技术支持。此外,该数据集也可用于本地化软件界面、数字内容创作以及语言教学材料的生成,助力加纳地区的信息化建设与文化传播。通过低资源语言的赋能,其应用前景覆盖了从日常生活到专业领域的广泛场景。
衍生相关工作
基于 Ghana Corpus 数据集,研究社区已衍生出多项经典工作,包括开发专门的加纳语机器翻译模型(如基于 Transformer 架构的翻译系统),以及构建多语言预训练语言模型以提升低资源语言的表示能力。此外,该数据集还催生了加纳语语音识别与文本转语音系统的研究,推动了方言对齐工具的创建。配套的 Ghana Corpus Builder 工具更是简化了数据加载与处理流程,成为后续研究的基础设施,促进了相关论文与开源项目的涌现。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务