LLM预训练数据集
收藏官方服务:
资源简介:
该数据是一个用于中文 LLM 预训练研究/教学的清洗语料,由开源项目数据管线产出。数据规模约 49.6 亿 tokens,已切分为 train(44.6 亿 tokens)/ valid(2.48 亿)/ test(2.49 亿),比例约 90:5:5。 数据来源:chinese-fineweb-edu(55%)、中文新闻(27%)、中文 Wikipedia(12%)、百度百科(6%),经精确去重、SimHash 去重、质量过滤(中文占比≥15%、长度 30~3000 字)后按配比混合。数据集有两种格式:① UTF-8 纯文本 .txt(每行一篇文档),可搭配任意分词器使用;② Megatron IndexedDataset 兼容的 .bin/.idx,需配套 BBPE-12k 分词器(随数据集发布)。本数据集由公开网络语料经自动化管线处理生成,无意侵犯任何第三方权益。如您认为其中内容侵犯了您的著作权或其他合法权益,请通过 邮件(philex_hf@163.com)联系我们,我们将在核实后下架并删除相关数据。
提供机构:
maas创建时间:
2026-09-04



