遇见数据集

NITHUB-AI/Ehn-bible

收藏
Hugging Face2023-09-04 更新2024-03-04 收录
官方服务:

资源简介:

Ehn-Bible-BBC-GPT3.5数据集包含尼日利亚皮钦语和英语的平行句子,分为训练集、验证集和测试集,比例为8:1:1。数据来源于圣经,使用现代英语翻译版本。数据集支持语言翻译和语言识别任务。数据集的创建过程包括数据抓取、存储和分割。数据集的局限性在于主要来源于宗教文本,且不包含其他版本的皮钦语。

The Ehn-Bible-BBC-GPT3.5 dataset consists of parallel sentence pairs between Nigerian Pidgin and English, and is split into training, validation and test sets at a ratio of 8:1:1. The data is sourced from the Bible, leveraging modern English translation versions. This dataset supports language translation and language identification tasks. The dataset creation workflow includes data crawling, storage and splitting. The limitations of this dataset are that it is primarily derived from religious texts, and does not cover other variants of Pidgin.

提供机构:
NITHUB-AI
原始信息汇总

数据集卡片 Ehn-Bible-BBC-GPT3.5

数据集描述

数据集摘要

该数据集包含尼日利亚皮金语和英语的平行句子,分为三个文件:train.csvvalid.csvtest.csv。原始数据按 8:1:1 的比例分割成这些文件。

支持的任务和排行榜

  • 语言翻译
  • 语言识别

语言

  • 英语
  • 尼日利亚皮金语

数据集结构

数据实例

英语 皮金
" Do you want to kill me as you did the Egyptian yesterday?’ " " Hope yu nor won kill mi di way yu kill dat Egypt man yestiday?’ "
" “Go and cry in the hearing of Jerusalem, saying, ‘Thus says the Lord : “I remember you, The kindness of your youth, The love of your betrothal, When you went after Me in the wilderness, In a land not sown." " “Go tell evribody for Jerusalem sey: ‘God sey, “I remember as una dey faithful wen una dey yong. Una bin love mi well-well like woman wey just marry; una follow mi waka for wildaness and for dry land. "
" Therefore I take pleasure in infirmities, in reproaches, in needs, in persecutions, in distresses, for Christ’s sake. For when I am weak, then I am strong." " I dey happy as I dey weak with all di curse, trobols, ponishment and wahala wey I dey sofa bikos of Christ, bikos anytime wey I dey weak, na dat time, I dey-dey strong. "

数据字段

  • English: 包含英语句子
  • Pidgin: 包含对应的尼日利亚皮金语句子

数据分割

  • 训练集 (60%)
  • 验证集 (20%)
  • 测试集 (20%)

数据集创建

数据集创建理由

数据从圣经的上下文中筛选出来,这是最大的英语-尼日利亚皮金语平行句子的可用来源。英语句子使用了圣经的《The Message》翻译版本,因为它呈现了最现代的英语形式。

源数据

初始数据收集和规范化

  • 数据使用Python中的BeautifulSoup进行抓取并存储在MongoDB数据库中
  • 圣经来源的数据按章节分割成样本,因为这是保留平行句子之间上下文的最简单方法。主要是因为英语和尼日利亚皮金语的句子不是完美匹配的。

源语言生产者

个人和敏感信息

除了圣经中已有的信息外,没有额外努力去除敏感信息。

使用数据集的考虑因素

数据集的社会影响

该数据使得工程师更容易构建适用于不太识字但数字连接的尼日利亚受众的语言工具。

偏见讨论

数据主要集中在现代英语的圣经文本上。这限制了数据的多样性和基于其构建的系统的灵活性。

其他已知限制

  • 数据不包含其他版本的皮金语,如Warri皮金语或其他非洲国家的皮金语。
  • 数据包含有限数量的上下文,主要来自宗教角度。
搜集汇总
数据集介绍
NITHUB-AI/Ehn-bible 数据集图片
构建方式
本数据集聚焦于尼日利亚皮钦语与英语的平行语料构建,其核心数据源自圣经文本,因为该领域提供了最丰富的英-皮钦语平行句对。英文部分选取了《The Message》现代译本,以确保语言的当代性。数据采集利用Python中的BeautifulSoup工具进行网页抓取,并存储于MongoDB数据库。为保留平行句之间的上下文关联,数据按圣经节进行切分,从而克服了英文与皮钦语句子不完全匹配的挑战。最终,原始数据以8:1:1的比例划分为训练集、验证集和测试集,分别占比60%、20%和20%。
特点
该数据集具有鲜明的领域专属性与语言对等性,其特点在于聚焦于宗教文本语境下的尼日利亚皮钦语与英语平行翻译。数据以句子级对齐为基本单位,确保了翻译对之间的语义连贯性。此外,数据集明确区分了训练、验证和测试子集,为机器翻译和语言识别任务提供了标准化的评估框架。然而,其局限性也显而易见,即数据来源单一,主要局限于圣经内容,且未涵盖尼日利亚其他地区的皮钦语变体,如瓦里皮钦语,从而限制了模型的泛化能力。
使用方法
该数据集主要面向自然语言处理中的机器翻译与语言识别任务。使用者可直接加载CSV格式的原始文件,其中包含'english'和'pidgin'两个字段,分别对应英文和尼日利亚皮钦语句子。数据已预分为训练、验证和测试集,便于直接用于模型训练与评估。推荐采用标准序列到序列或基于Transformer的翻译架构进行实验。同时,鼓励熟悉尼日利亚皮钦语的贡献者参与数据扩展,以增强语料的多样性和覆盖范围,进而提升构建系统的鲁棒性。
背景与挑战
背景概述
在自然语言处理领域,低资源语言的机器翻译与语言识别任务长期面临数据匮乏的困境,尤其是像尼日利亚皮钦语这种广泛使用却缺乏规范化语料库的语言。Ehn-Bible数据集由Fortune Adekogbe与Joseph Olaide于近期创建,依托尼日利亚本地研究机构NITHUB-AI,旨在填补英语与尼日利亚皮钦语平行语料的空白。该数据集以圣经文本为核心来源,选取现代英语译本《The Message》与YouVersion平台的皮钦语译本,通过网页爬取与人工对齐构建了包含约数万句对的平行语料。作为首个公开的大规模英语-尼日利亚皮钦语平行数据集,它为低资源语言翻译模型、跨语言迁移学习以及非洲本土语言技术发展提供了关键基础资源,对推动非洲数字包容性具有里程碑意义。
当前挑战
该数据集面临多重挑战。首先,在领域问题层面,尼日利亚皮钦语作为混合型克里奥尔语,缺乏标准化拼写与语法规则,不同地区(如瓦里皮钦语)存在显著变体,导致模型泛化困难;同时,数据仅覆盖宗教文本语境,无法支持通用场景的翻译需求。其次,在构建过程中,圣经句子在英语与皮钦语间并非完美对应,需依赖逐节切分与人工校验以确保语义对齐,过程耗时且易引入偏差;此外,数据集规模有限,且未包含敏感信息过滤机制,可能隐含宗教文化偏见,进一步限制了其在实际应用中的鲁棒性与公平性。
常用场景
经典使用场景
在自然语言处理领域,该数据集最为经典的使用场景是构建尼日利亚皮钦语与英语之间的神经机器翻译模型。由于尼日利亚皮钦语作为一种低资源语言,缺乏大规模、高质量的平行语料库,Ehn-Bible数据集以圣经文本为语料来源,提供了结构化的双语对齐句子,为训练端到端的翻译系统奠定了坚实基础。研究人员通常利用其划分好的训练、验证和测试集,评估Transformer等主流架构在皮钦语翻译任务上的表现。此外,该数据集还可用于语言识别任务,帮助模型区分皮钦语与英语的细微差异,推动多语言理解技术的发展。
实际应用
在实际应用中,该数据集催生了面向尼日利亚皮钦语用户的实用语言工具开发。由于尼日利亚拥有大量仅使用皮钦语交流但数字设备普及率较高的群体,基于该数据集训练的翻译系统可集成到社交媒体平台、新闻阅读应用或即时通讯工具中,帮助用户跨越语言障碍获取英语信息。例如,BBC News Pidgin等新闻机构可借助此类模型自动将英语报道转化为皮钦语版本,扩大信息覆盖面。此外,该数据集还可支持语音助手、客服机器人等场景,使数字服务更加普惠,尤其适用于教育、医疗和公共服务等需要本地化沟通的领域。
衍生相关工作
该数据集衍生了一系列具有影响力的相关研究工作。首先,它推动了低资源语言翻译中数据增强技术的创新,如基于回译和噪声注入的方法被验证可有效提升皮钦语翻译质量。其次,研究者利用该数据集探索了多任务学习框架,将语言识别与机器翻译联合训练,进一步优化了模型在皮钦语上的泛化能力。此外,该数据集还启发了对圣经语料作为平行数据源的批判性分析,促使学界关注语域偏见问题,并催生了从新闻、社交媒体等多元渠道补充低资源语言数据的研究方向。这些工作共同拓展了低资源NLP的理论边界与实践路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务