shadow
收藏资源简介:
SHADOW 数据集是为训练 250M 子比特模型而构建的预训练与微调数据集。该数据集使用 Gemma-3 tokenizer 对原始文本进行分词,并将 token id 频率子集限制为 131,072 个,同时提供了将子集 id 映射回原始 id 的表格。数据组织方式包括:每个来源的训练目录(`{source}/train/`)包含 uint32 token 流(以 <eos>=1 分隔文档)、uint64 文档起始偏移以及 uint32 UTF-8 字节数;存档目录(`{source}/archive/`)包含用于预训练阶段未使用的预留数据;`sft/` 目录包含 Supra2-100M-Instruct 混合数据及检索格式上下文问答数据,并带有损失掩码;`rlvr/` 目录包含嵌入检索的存档数据(1M/10M/100M 规模)及可验证的问题库;`tokenizer/` 目录提供映射表;`MANIFEST.json` 列出每个分片的 token 计数。数据集总 token 数约为 35.35B(具体分布:dclm: 10.316B, fineweb_edu: 21.657B, pg19: 2.862B, wikipedia: 0.519B 等)。数据来源包括 FineWeb-Edu、DCLM、PG19、Wikipedia、SmolTalk、Grade School Math Instructions、No Robots、SupraThink-Dataset-500x、SQuAD(v2) 和 HotpotQA,每个来源保留其原始许可证。该数据集适用于语言模型预训练、指令微调以及检索增强生成等任务。
The SHADOW dataset is a pre-training and fine-tuning dataset constructed for training a 250M sub-bit model. It uses the Gemma-3 tokenizer to tokenize raw text, restricts the token id frequency subset to 131,072, and provides a mapping table from subset ids back to original ids. Data organization includes: training directories for each source (`{source}/train/`) containing uint32 token streams (documents separated by <eos>=1), uint64 document start offsets, and uint32 UTF-8 byte counts; archive directories (`{source}/archive/`) containing reserved data unused during pre-training; `sft/` directory containing Supra2-100M-Instruct mixed data and retrieval-style context QA data with loss masks; `rlvr/` directory containing embedded retrieval archive data (1M/10M/100M scales) and verifiable question banks; `tokenizer/` directory providing mapping tables; `MANIFEST.json` listing token counts for each shard. The total token count is approximately 35.35B (distribution: dclm: 10.316B, fineweb_edu: 21.657B, pg19: 2.862B, wikipedia: 0.519B, etc.). Data sources include FineWeb-Edu, DCLM, PG19, Wikipedia, SmolTalk, Grade School Math Instructions, No Robots, SupraThink-Dataset-500x, SQuAD(v2), and HotpotQA, each retaining its original license. The dataset is suitable for language model pre-training, instruction fine-tuning, and retrieval-augmented generation tasks.
数据集概述:SHADOW
SHADOW 是一个用于训练 2.5 亿参数“亚比特”模型的数据集,其核心特点是使用 Gemma-3 分词器 的 token ID,并将词表频率子集缩减至 131,072 个 token。原始 ID 与子集 ID 之间的映射关系可通过 tokenizer/new2old.npy 文件恢复(被丢弃的 ID 已无损扩展为 Gemma 字节回退 token)。每个分片(shard)均包含文档边界标记。
数据构成与格式
数据集按来源和用途分为多个目录,主要格式为:
- 训练数据 (
{source}/train/):NNNN.tok.u32:uint32 格式的 token 流,每个文档后以<eos>(ID=1)分隔。NNNN.doc.u64:uint64 格式的文档起始偏移量(含最终结尾偏移)。NNNN.byt.u32:每个文档对应的 UTF-8 字节数。
- 留出数据 (
{source}/archive/):针对 1 亿 token 上下文归档的留出分片,绝不参与预训练。 - 指令微调数据 (
sft/):包含 Supra2-100M-Instruct 混合数据及检索格式的上下文问答,附有损失掩码文件(.msk.u8)。 - 强化学习数据 (
rlvr/):包含植入“针”的归档数据(规模为 1M/100M/1亿 token)及可验证问题库。 - 分词器映射 (
tokenizer/):提供old2new.npy、new2old.npy、expansion.json、remap.json等映射表。 - 清单文件 (
MANIFEST.json):记录每个分片的 token 数量。
数据规模与来源
总 token 数(单位:十亿) 分布如下:
| 数据源 | 训练集 (train) | 归档集 (archive) |
|---|---|---|
| dclm | 9.287 B | 1.029 B |
| fineweb_edu | 20.911 B | 0.746 B |
| pg19 | 2.476 B | 0.372 B |
| pg19_eval | - | 0.014 B |
| wikipedia | - | 0.444 B |
| wikipedia_simple | - | 0.075 B |
数据来源包括:HuggingFaceFW/fineweb-edu(sample/100BT)、HuggingFaceFW/dclm_100BT-shuffled、emozilla/pg19、wikimedia/wikipedia、HuggingFaceTB/smol-smoltalk、qwedsacf/grade-school-math-instructions、HuggingFaceH4/no_robots、SupraLabs/SupraThink-Dataset-500x、rajpurkar/squad(+v2) 以及 hotpotqa/hotpot_qa。每个数据源均保留其原始许可证。




