Eng-PidginBioData: English–Nigerian Pidgin Biology Translation Dataset
收藏资源简介:
Dataset Summary Eng-PidginBioData is a domain-specific parallel corpus for English ↔ Nigerian Pidgin machine translation focused on biological and scientific texts. The dataset contains 2,300 sentence pairs extracted from open-source biological research papers and manually translated into Nigerian Pidgin. The dataset was created to support research in low-resource language machine translation, particularly for Nigerian Pidgin, which despite being spoken by millions of people remains underrepresented in scientific literature and NLP resources. This dataset was introduced in the paper: "How Effective Are AI Models in Translating English Scientific Texts to Nigerian Pidgin: A Low-Resource Language?"ICLR 2025 Workshop: I Can’t Believe It’s Not Better.



