OpenCSG Chinese Corpus
收藏资源简介:
OpenCSG中文语料库由清华大学和OpenCSG联合创建,旨在为大语言模型的训练提供高质量的中文数据集。该语料库包含四个数据集:Fineweb-edu-chinese、Fineweb-edu-chinese-v2、Cosmopedia-chinese和Smoltalk-chinese。Fineweb-edu数据集专注于从多样化的中文网络资源中筛选高质量内容,Cosmopedia-chinese提供合成教材风格的数据,Smoltalk-chinese则强调多样化的聊天格式数据。数据集通过自动化评分和合成文本生成技术构建,具有高质量、多样性和开放性,适用于中文大语言模型的预训练、后训练和微调。
The OpenCSG Chinese Corpus, jointly created by Tsinghua University and OpenCSG, is designed to provide high-quality Chinese datasets for the training of large language models. The corpus encompasses four datasets: Fineweb-edu-chinese, Fineweb-edu-chinese-v2, Cosmopedia-chinese, and Smoltalk-chinese. The Fineweb-edu dataset focuses on selecting high-quality content from diverse Chinese online resources, Cosmopedia-chinese offers synthetic teaching material-style data, and Smoltalk-chinese emphasizes diverse chat format data. The datasets are constructed through automated scoring and synthetic text generation techniques, featuring high quality, diversity, and openness, and are suitable for pre-training, post-training, and fine-tuning of Chinese large language models.




