genggui001/gg_zh_v1_550B
收藏官方服务:
资源简介:
该数据集整合了多个子数据集,包括CCI-Data、SkyPile-150B、TeleChat-PTD等,经过minhash去重处理后,形成了550B的中文预训练语料。该数据集适用于文本生成任务,语言为中文,数据规模在100B到1T之间。
This dataset integrates multiple subdatasets, including CCI-Data, SkyPile-150B, TeleChat-PTD, and others. After being deduplicated using the MinHash algorithm, it yields a 550B Chinese pre-training corpus. This dataset is suitable for text generation tasks, uses Chinese as its language, and has a data scale ranging from 100B to 1T.
提供机构:
genggui001原始信息汇总
数据集概述
任务类别
- 文本生成
语言
- 中文
数据规模
- 100B<n<1T
数据集列表
- CCI-Data
- SkyPile-150B
- TeleChat-PTD
- WebText-cn
- WuDaoCorpus2.0
- wangan
- yayi2_pretrain_data
数据处理
- 整合并使用minhash去重,最终得到550B中文预训练语料



