english_nuer_sentence-pairs_1M
收藏资源简介:
English–Nuer Sentence Pairs (1M) 是一个大规模双语平行语料库,包含约100万条对齐的英语和努尔语(Thok Naath)句子对。该数据集旨在支持机器翻译、多语言自然语言处理(NLP)、跨语言表示学习以及低资源非洲语言技术的开发研究。同时,该项目也有助于努尔语(Thok Naath)的数字保存和可访问性。
English–Nuer Sentence Pairs (1M) is a large-scale bilingual parallel corpus containing approximately 1 million aligned English and Nuer (Thok Naath) sentence pairs. This dataset aims to support machine translation, multilingual natural language processing (NLP), cross-lingual representation learning, and the development of technologies for low-resource African languages. Additionally, this project contributes to the digital preservation and accessibility of the Nuer (Thok Naath) language.
数据集概述
- 名称: English–Nuer Sentence Pairs (1M)
- 规模: 约 100 万条对齐的英语–努埃尔语(Thok Naath)句子对
- 语言: 英语 (
en)、努埃尔语/Thok Naath (nus) - 许可协议: Creative Commons Attribution–NonCommercial–ShareAlike 4.0 International (CC BY-NC-SA 4.0),仅限研究和教育用途,禁止商业使用
任务与标签
- 任务类别: 翻译、文本生成
- 标签: 机器翻译、平行语料库、多语言、英语、努埃尔语、Thok Naath、低资源语言、非洲语言、语言保护、大语言模型、神经机器翻译
数据集用途
- 神经机器翻译
- 大语言模型预训练与微调(仅限研究)
- 跨语言表示学习
- 句子嵌入模型
- 平行语料库研究
- 多语言自然语言处理
- 语言学分析
- 低资源语言研究
- 基准评估
- 语言保护与语言学研究
使用限制
- 仅限学术研究与教育目的
- 严禁商业用途,包括:训练商业AI或大语言模型、商业翻译系统、付费API、SaaS产品、专有AI服务、销售或再分发数据集、将数据集集成到商业软件或产品中
- 商业使用需联系作者获取独立商业许可证
数据记录结构
- 每条记录包含一个英语句子及其对应的努埃尔语翻译
引用信息
bibtex @dataset{tajnaam2026english_nuer_1m, author = {Tajnaam}, title = {English–Nuer Sentence Pairs (1M)}, year = {2026}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/Tajnaam/english_nuer_sentence-pairs_1M} }
许可详情
致谢与伦理
- 数据集旨在支持努埃尔语(Thok Naath)的语言保护,鼓励低资源非洲语言研究
- 鼓励负责任地使用数据集,尊重努埃尔语社区
- 翻译错误或文化问题可通过 Hugging Face 仓库提交 issue
免责声明
- 数据集按“原样”提供,不提供任何担保,作者对错误、遗漏或误用不承担责任
联系
- 可通过 Hugging Face 仓库联系作者,处理问题、合作、更正或商业许可咨询




