ccibeekeoc42/english_to_igbo
收藏资源简介:
该数据集是一个包含英语和伊博语平行句子的综合集合,适用于机器翻译、语言研究和自然语言处理任务。数据集由多个来源组成,包括iamwille/igbo-translation数据集、Igbo-English Machine Translation数据集、自定义文本文件翻译和JW300文本数据。数据集分为训练集和测试集,每个条目包含英语和伊博语的句子对,格式为CSV。数据集可用于机器翻译、跨语言迁移学习和语言学研究等任务。
该数据集是一个包含英语和伊博语平行句子的综合集合,适用于机器翻译、语言研究和自然语言处理任务。数据集由多个来源组成,包括iamwille/igbo-translation数据集、Igbo-English Machine Translation数据集、自定义文本文件翻译和JW300文本数据。数据集分为训练集和测试集,每个条目包含英语和伊博语的句子对,格式为CSV。数据集可用于机器翻译、跨语言迁移学习和语言学研究等任务。
English-Igbo Parallel Corpus
描述
该数据集是英语和伊博语平行句子的综合集合。它从多个来源编译而成,旨在为机器翻译、语言研究和自然语言处理任务创建丰富的资源。该数据集对于专注于伊博语的研究尤为宝贵,伊博语主要在尼日利亚使用,在计算语言学领域中代表性不足。
组成
数据集包括以下组成部分:
-
iamwille/igbo-translation 数据集:最初来自Hugging Face,该子集包括涵盖各种主题的专业翻译句子。
-
Igbo-English 机器翻译数据集:该子集来自Papers with Code,提供额外的翻译句子,重点是常用短语和表达。
-
自定义文本文件翻译:从自定义文本文件中提取的英语-伊博语句子对,提供多样化的日常语言使用。
-
JW300 文本数据:来自JW300 语料库,这部分包括宗教和教育文本,增加了数据集的多样性。
数据集结构
数据分割
数据集分为两个部分:
- 训练集:包含大部分句子,用于训练机器翻译模型或其他NLP任务。
- 测试集:用于评估模型性能的一小部分句子。
数据字段
数据集中的每个条目包含两个字段:
English:英语句子或短语。Igbo:对应的伊博语翻译。
数据格式
数据集以CSV格式提供,每行代表一个平行句子对。
用途
该数据集可用于NLP中的各种任务,包括但不限于:
- 机器翻译
- 跨语言迁移学习
- 语言学研究
来源和致谢
该数据集从多个来源编译而成。我们感谢以下贡献者:
- Hugging Face 提供初始数据集。
- JW300 语料库的创建者。
- 自定义文本翻译的个别贡献者。
许可
该数据集在[指定许可证,例如MIT许可证]下发布。请在使用此数据集时遵守原始来源的许可条款。
联系
如有任何查询或贡献,请联系 Chinemerem Ibe-Ekeocha 在 ccibeekeoc42@gmail.com。



