YueData
收藏资源简介:
YueData是一个高质量的大型粤语语料库,由香港中文大学和香港大学的研究人员共同创建。该数据集从开源语料库、香港特色论坛、粤语维基百科和Common Crawl数据等多种来源收集粤语文本,经过语言过滤、质量过滤、内容过滤和去重等严格的数据处理流程,最终构建了一个超过20亿tokens的粤语语料库,为大型语言模型的训练奠定了坚实基础。
YueData is a high-quality large-scale Cantonese corpus jointly created by researchers from The Chinese University of Hong Kong and The University of Hong Kong. This dataset collects Cantonese text from diverse sources including open-source corpora, Hong Kong-specific forums, Cantonese Wikipedia and Common Crawl data. After undergoing rigorous data processing workflows such as language filtering, quality filtering, content filtering and deduplication, it finally constructs a Cantonese corpus with over 2 billion tokens, which lays a solid foundation for the training of large language models (LLMs).

- 1Developing and Utilizing a Large-Scale Cantonese Dataset for Multi-Tasking in Large Language Models香港中文大学, 香港大学 · 2025年



