遇见数据集

shadow

收藏
Hugging Face2026-08-17 更新2026-08-18 收录
官方服务:

资源简介:

SHADOW 数据集是为训练 250M 子比特模型而构建的预训练与微调数据集。该数据集使用 Gemma-3 tokenizer 对原始文本进行分词,并将 token id 频率子集限制为 131,072 个,同时提供了将子集 id 映射回原始 id 的表格。数据组织方式包括:每个来源的训练目录(`{source}/train/`)包含 uint32 token 流(以 <eos>=1 分隔文档)、uint64 文档起始偏移以及 uint32 UTF-8 字节数;存档目录(`{source}/archive/`)包含用于预训练阶段未使用的预留数据;`sft/` 目录包含 Supra2-100M-Instruct 混合数据及检索格式上下文问答数据,并带有损失掩码;`rlvr/` 目录包含嵌入检索的存档数据(1M/10M/100M 规模)及可验证的问题库;`tokenizer/` 目录提供映射表;`MANIFEST.json` 列出每个分片的 token 计数。数据集总 token 数约为 35.35B(具体分布:dclm: 10.316B, fineweb_edu: 21.657B, pg19: 2.862B, wikipedia: 0.519B 等)。数据来源包括 FineWeb-Edu、DCLM、PG19、Wikipedia、SmolTalk、Grade School Math Instructions、No Robots、SupraThink-Dataset-500x、SQuAD(v2) 和 HotpotQA,每个来源保留其原始许可证。该数据集适用于语言模型预训练、指令微调以及检索增强生成等任务。

The SHADOW dataset is a pre-training and fine-tuning dataset constructed for training a 250M sub-bit model. It uses the Gemma-3 tokenizer to tokenize raw text, restricts the token id frequency subset to 131,072, and provides a mapping table from subset ids back to original ids. Data organization includes: training directories for each source (`{source}/train/`) containing uint32 token streams (documents separated by <eos>=1), uint64 document start offsets, and uint32 UTF-8 byte counts; archive directories (`{source}/archive/`) containing reserved data unused during pre-training; `sft/` directory containing Supra2-100M-Instruct mixed data and retrieval-style context QA data with loss masks; `rlvr/` directory containing embedded retrieval archive data (1M/10M/100M scales) and verifiable question banks; `tokenizer/` directory providing mapping tables; `MANIFEST.json` listing token counts for each shard. The total token count is approximately 35.35B (distribution: dclm: 10.316B, fineweb_edu: 21.657B, pg19: 2.862B, wikipedia: 0.519B, etc.). Data sources include FineWeb-Edu, DCLM, PG19, Wikipedia, SmolTalk, Grade School Math Instructions, No Robots, SupraThink-Dataset-500x, SQuAD(v2), and HotpotQA, each retaining its original license. The dataset is suitable for language model pre-training, instruction fine-tuning, and retrieval-augmented generation tasks.

创建时间:
2026-08-16
原始信息汇总

数据集概述:SHADOW

SHADOW 是一个用于训练 2.5 亿参数“亚比特”模型的数据集,其核心特点是使用 Gemma-3 分词器 的 token ID,并将词表频率子集缩减至 131,072 个 token。原始 ID 与子集 ID 之间的映射关系可通过 tokenizer/new2old.npy 文件恢复(被丢弃的 ID 已无损扩展为 Gemma 字节回退 token)。每个分片(shard)均包含文档边界标记。

数据构成与格式

数据集按来源和用途分为多个目录,主要格式为:

  • 训练数据 ({source}/train/):
    • NNNN.tok.u32:uint32 格式的 token 流,每个文档后以 <eos>(ID=1)分隔。
    • NNNN.doc.u64:uint64 格式的文档起始偏移量(含最终结尾偏移)。
    • NNNN.byt.u32:每个文档对应的 UTF-8 字节数。
  • 留出数据 ({source}/archive/):针对 1 亿 token 上下文归档的留出分片,绝不参与预训练。
  • 指令微调数据 (sft/):包含 Supra2-100M-Instruct 混合数据及检索格式的上下文问答,附有损失掩码文件(.msk.u8)。
  • 强化学习数据 (rlvr/):包含植入“针”的归档数据(规模为 1M/100M/1亿 token)及可验证问题库。
  • 分词器映射 (tokenizer/):提供 old2new.npynew2old.npyexpansion.jsonremap.json 等映射表。
  • 清单文件 (MANIFEST.json):记录每个分片的 token 数量。

数据规模与来源

总 token 数(单位:十亿) 分布如下:

数据源 训练集 (train) 归档集 (archive)
dclm 9.287 B 1.029 B
fineweb_edu 20.911 B 0.746 B
pg19 2.476 B 0.372 B
pg19_eval - 0.014 B
wikipedia - 0.444 B
wikipedia_simple - 0.075 B

数据来源包括:HuggingFaceFW/fineweb-edu(sample/100BT)、HuggingFaceFW/dclm_100BT-shuffled、emozilla/pg19、wikimedia/wikipedia、HuggingFaceTB/smol-smoltalk、qwedsacf/grade-school-math-instructions、HuggingFaceH4/no_robots、SupraLabs/SupraThink-Dataset-500x、rajpurkar/squad(+v2) 以及 hotpotqa/hotpot_qa。每个数据源均保留其原始许可证。

搜集汇总
数据集介绍
shadow 数据集图片
构建方式
SHADOW数据集是针对250M子比特模型精心构建的大规模预训练语料,其构建方式独具匠心。数据集的Token ID基于Gemma-3分词器,并经过频率子集筛选,映射至131,072个ID空间,确保与原始Gemma-3 270m模型的无损兼容,同时通过扩展字节回退Token实现信息的完备保留。语料来源涵盖FineWeb-Edu、DCLM、PG19、Wikipedia等多个高质量文本源,并经过清洗与去重,最后以分片(shard)形式存储,每个分片均标注文档边界,便于高效检索与训练。
特点
该数据集的核心特点在于其结构设计的专业性与灵活性。每个训练分片包含UInt32格式的Token流、UInt64的文档偏移索引以及UTF-8字节记录,实现数据存储的高效与透明。特别地,数据集设有独立的归档分片(archive),专为100M Token超长上下文场景预留,确保评测与训练数据严格隔离。此外,SFT指令微调部分融合了Supra2-100M-Instruct与多源问答数据,并配备掩码文件以精确控制损失计算;RLVR部分则植入针式测试档案,支持验证性问答,为强化学习提供坚实基础。
使用方法
使用SHADOW数据集时,研究者可依据MANIFEST.json清单选择所需分片,并利用提供的tokenizer重映射表(old2new.npy等)将ID还原至原始Gemma-3词汇表,便于预训练模型的加载。训练流程中,推荐依次加载train目录下的分片,利用.doc文件定位文档边界,实现流式处理。对于长上下文场景,可选用archive分片进行持续预训练;针对指令遵循与推理任务,则使用sft目录中的掩码数据,配合.msk文件进行有监督微调。RLVR数据则适用于强化学习阶段的评估与对齐实验。
背景与挑战
背景概述
SHADOW数据集诞生于2025年,由致力于探索次比特级语言模型极限的研究团队构建,旨在为参数量仅2.5亿的紧凑型模型提供高质量预训练语料。该数据集巧妙地将Gemma-3分词器词表压缩至131,072个高频子集,同时保持无损的字节回退映射,确保了模型在显著减少参数量的情况下仍能高效学习。其数据来源广泛,整合了FineWeb-Edu、DCLM、PG19、维基百科等多元语料,并特别设计了训练集与归档集分离的架构,为超长上下文建模(高达1亿token)预留了验证空间。SHADOW的发布为资源受限环境下的高效语言模型研究开辟了新路径,其精细的文档边界标注和字节级元数据也为后续的检索增强生成与指令微调提供了坚实基础,在推动紧凑型模型性能跃升方面具有里程碑意义。
当前挑战
SHADOW数据集面临的核心挑战在于,如何在极端参数压缩(250M)下兼顾语言建模的泛化能力与知识密度,这要求词表裁剪策略必须在不损失语义信息的前提下,通过字节回退机制实现无损编码,而频率子集选择与映射表的构建本身就是一项精密工程。构建过程中,跨源异构数据的统一去重、清洗与格式转换(如uint32/uint64序列化)显著增加了流水线复杂度,尤其是确保每个分片内文档边界的准确性与训练集-归档集的严格隔离,以防止数据泄漏。此外,为了支持100M token的上下文窗口,需要设计高效的归档分片与文档偏移索引,这在大规模存储和I/O优化上提出了严苛要求。同时,有效融合指令数据(如SFT与RLVR子集)并实现精准的损失掩码,以平衡预训练与对齐阶段,也是模型最终性能能否突破的关键难点。
常用场景
经典使用场景
SHADOW数据集作为专为250M亚比特级语言模型预训练精心构建的高质量语料库,其经典使用场景聚焦于大规模、多源异构文本的混合训练。数据集整合了FineWeb-Edu、DCLM、PG19、Wikipedia等多样化来源,涵盖教育文本、学术文献、百科知识及指令对话,以统一分词器映射至Gemma-3词表子集,并保留文档边界与token级结构,尤其适用于训练上下文压缩、高效解码及长序列建模的紧凑型语言模型。其独特的归档分片设计支持对100M-token级超长上下文的评估,为研究亚比特量化下的模型性能与token效率权衡提供了标准化实验基准。
解决学术问题
该数据集有效解决了低比特容量语言模型研究中高质量训练语料匮乏的难题。通过频率子集化与无损字节回退机制,SHADOW确保了在缩减词表至131,072个token时信息不丢失,使得研究者得以严格分离词表压缩与模型架构的影响。它支持对预训练数据配比、文档级采样的系统性消融实验,并借助保留的验证分片(archive)避免了数据泄漏,从而为探索亚比特模型的鲁棒性、泛化能力以及token效率边界提供了可靠保障,推动了资源受限环境下语言模型设计理论的实证进展。
衍生相关工作
围绕SHADOW数据集,衍生了一系列极具影响力的相关研究工作。一方面,其分词器重映射机制与无损压缩方案启发了后续关于词汇表紧凑化及多语言扩展的研究;另一方面,基于其100M-token归档集的长上下文评估基准,催生了对亚比特模型记忆容量与位置编码外推能力的深入探讨。此外,数据集中的可验证问题库与针植档案被元用于开发面向小模型的自我对弈强化学习流程,以及与Supra2-100M-Instruct结合的混合专家微调策略,有效促进了高效小模型领域从数据制备、模型训练到能力评测的全链条创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务