English–Karakalpak Parallel Corpus v9
收藏官方服务:
资源简介:
English–Karakalpak Parallel Corpus v9 is a high-quality bilingual parallel corpus designed for machine translation, natural language processing, and large language model research. The dataset contains sentence-aligned English and Karakalpak text pairs collected from multiple publicly available sources. Each English sentence corresponds to exactly one Karakalpak sentence. The corpus has been manually cleaned and aligned to improve translation quality. It is intended for research on low-resource languages, neural machine translation, and multilingual language models. The latest version of this dataset is maintained on Hugging Face: https://huggingface.co/datasets/bekan/english_karakalpak_parallel_corpus_v9
提供机构:
Zenodo创建时间:
2026-07-16



