遇见数据集

English–Karakalpak Parallel Corpus v8

收藏
Zenodo2026-07-14 更新2026-08-01 收录
官方服务:

资源简介:

English–Karakalpak Parallel Corpus v8 is a high-quality bilingual parallel corpus designed for machine translation, natural language processing, and large language model research. The dataset contains sentence-aligned English and Karakalpak text pairs collected from multiple publicly available sources. Each English sentence corresponds to exactly one Karakalpak sentence. The corpus has been manually cleaned and aligned to improve translation quality. It is intended for research on low-resource languages, neural machine translation, and multilingual language models. The latest version of this dataset is maintained on Hugging Face:https://huggingface.co/datasets/bekan/english_karakalpak_parallel_corpus_v8

提供机构:
Zenodo
创建时间:
2026-07-14
二维码
社区交流群
二维码
科研交流群
商业服务