遇见数据集

shadow-o-logits-20b

收藏
Hugging Face2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

SHADOW-O OLMo-2 Top-16 Logits (20B) 是一个用于训练252.8M参数SHADOW-O学生模型的数据集,提供稀疏的下一令牌教师logits。该数据集基于教师模型allenai/OLMo-2-0425-1B生成,令牌ID空间采用AI2 Dolma/OLMo的前100,278个ID,上下文长度为2,048。数据以高效格式存储:输入令牌为uint32类型,教师top-16令牌ID为uint32类型,教师未归一化logits为float16类型。计划总规模为20B令牌,约2.0 TB,捕获过程可恢复,学生模型在捕获的top-16集合上重新归一化教师和学生分布。数据混合计划包括:6.4B基础数据(教育导向爬取、Wikipedia、Stack-Edu)、4.55B密度数据(数学、代码、阅读理解)、4.55B推理数据(数学、代码、合成QA、元推理)和4.5B退火数据(推理轨迹、FLAN/Tülu SFT、可验证问题)。底层令牌流源自AI2的公共OLMo/Dolma数据分布,保留了适用的源许可证和归属要求。该数据集适用于文本生成任务,特别是基于知识蒸馏的模型训练,语言为英语,许可证为odc-by。

SHADOW-O OLMo-2 Top-16 Logits (20B) is a dataset for training the 252.8M-parameter SHADOW-O student model, which provides sparse next-token teacher logits. This dataset is generated based on the teacher model allenai/OLMo-2-0425-1B, utilizes the first 100,278 token IDs from the AI2 Dolma/OLMo vocabulary, and has a context length of 2,048. The data is stored in an efficient format: input tokens are of type uint32, teacher top-16 token IDs are of type uint32, and teacher unnormalized logits are of type float16. The planned total scale is 20B tokens, approximately 2.0 TB. The capture process is recoverable, and the student model re-normalizes both the teacher and student distributions over the captured top-16 token set. The data mixing plan includes: 6.4B base data (education-focused crawls, Wikipedia, Stack-Edu), 4.55B density data (mathematics, code, reading comprehension), 4.55B reasoning data (mathematics, code, synthetic QA, meta-reasoning), and 4.5B annealing data (reasoning trajectories, FLAN/Tülu SFT, verifiable questions). The underlying token stream originates from AI2's public OLMo/Dolma data distribution, with applicable source licenses and attribution requirements retained. This dataset is suitable for text generation tasks, particularly model training based on knowledge distillation. It is in English, licensed under odc-by.

创建时间:
2026-07-26
原始信息汇总

SHADOW-O OLMo-2 Top-16 Logits (20B) 数据集

基本信息

  • 数据集名称: SHADOW-O OLMo-2 top-16 logits
  • 许可证: ODC-BY (Open Data Commons Attribution License)
  • 任务类别: 文本生成
  • 语言: 英语

数据集描述

该数据集包含稀疏的下一词元教师logits,用于训练252.8M参数的SHADOW-O学生模型。

技术规格

  • 教师模型: allenai/OLMo-2-0425-1B
  • 词元ID空间: AI2 Dolma/OLMo,前100,278个ID
  • 上下文长度: 2,048
  • 存储格式: 每个词元存储输入uint32、前16个ID uint32、前16个logits float16
  • 计划规模: 20B词元,约2.0 TB
  • 捕获代码: SHADOW-O工作区中的 10_distill/capture_logits.py

文件结构

每个逻辑分片包含三个同名基础名的文件:

  • *.tok.npy: 输入词元,形状 [N]
  • *.ids.npy: 教师前n个词元ID,形状 [N, 16]
  • *.val.npy: 未归一化的教师logits,形状 [N, 16]

数据捕获机制

捕获过程支持断点续传,仅在所有数组写入并上传完成后才提交源分片。学生模型将基于捕获的前16个集合对教师和学生的分布进行重新归一化。

计划20B混合数据构成

  • 基础数据: 6.4B 面向教育的爬取数据、维基百科和Stack-Edu
  • 密度数据: 4.55B 数学、代码和阅读理解
  • 推理数据: 4.55B 数学、代码、合成问答和元推理
  • 退火数据: 4.5B 推理轨迹、FLAN/Tülu SFT和可验证问题

数据来源与版权

底层词元流来自AI2的公开OLMo/Dolma数据分布,保留其适用的源许可证和归属要求。

搜集汇总
数据集介绍
shadow-o-logits-20b 数据集图片
构建方式
SHADOW-O Logits-20B 数据集是为训练 252.8M 参数的 SHADOW-O 学生模型而构建的稀疏下一词元教师逻辑值集合。其教师模型采用 Allen AI 的 OLMo-2-0425-1B,词元 ID 空间基于 AI2 Dolma/OLMo 的前 100,278 个 ID,上下文窗口为 2,048 个词元。每个词元存储为三个数组:输入词元(uint32)、教师模型前 16 个最高概率词元的 ID(uint32)及其对应的未归一化逻辑值(float16),整体划分为多个逻辑分片,每个分片包含 .tok.npy、.ids.npy 和 .val.npy 三文件。数据捕获过程支持断点续传,仅当所有数组写入并上传成功后,源分片才会提交,确保数据完整性。
特点
该数据集总规划为 200 亿词元,体积约 2.0 TB,具有稀疏化存储和高密度信息压缩的特点。它仅保留教师模型的前 16 个逻辑值,大幅降低存储与计算开销,同时学生模型会在捕获的 top-16 集合内对教师与学生分布进行重归一化。数据混合精心设计,包含 64 亿词元的基础部分(教育类网页、维基百科、Stack-Edu)、45.5 亿词元的密度部分(数学、代码、阅读理解)、45.5 亿词元的推理部分(数学、代码、合成问答、元推理)以及 45 亿词元的退火部分(推理轨迹、FLAN/Tülu SFT、可验证问题),覆盖广泛的知识与技能维度。
使用方法
使用该数据集时,需加载逻辑分片中的三个 .npy 文件,分别获取输入词元、教师 top-16 词元 ID 和对应逻辑值。在训练 SHADOW-O 学生模型过程中,应依据教师分布的 top-16 集合对学生分布进行重归一化处理,以计算蒸馏损失。数据集底层词元流源自 AI2 公开的 OLMo/Dolma 数据发布,用户须遵守各源数据的许可协议和署名要求。数据加载可采用 NumPy 或 PyTorch 的数组读取函数,按分片进行流式或批量训练,建议实现可恢复的数据管道以应对大规模处理需求。
背景与挑战
背景概述
shadow-o-logits-20b数据集由艾伦人工智能研究所(AI2)于近期创建,旨在支持知识蒸馏场景下的高效语言模型训练。该数据集存储了OLMo-2-0425-1B教师模型在100,278个token ID空间上针对上下文长度为2048的序列生成的前16个候选token的logits值,计划包含20B个token,规模约2.0TB。核心研究问题聚焦于如何通过稀疏化教师分布(仅保留top-16 logits)降低蒸馏计算成本,同时保持学生模型的学习质量。该数据集为轻量级252.8M参数的SHADOW-O学生模型提供训练信号,其混合数据来源涵盖教育类爬虫、维基百科、数学与代码推理等多领域语料,对推动高效、可扩展的蒸馏训练范式具有重要影响。
当前挑战
数据集所解决的领域挑战在于:现有知识蒸馏方法通常需存储完整教师logits分布,导致存储和计算开销随词汇表规模急剧增长,限制了大模型蒸馏的实用性。shadow-o-logits-20b通过仅保留top-16候选的稀疏logits方案,在保持有效监督信号的同时将存储量降低数个数量级,但模型需在有限分布上准确还原教师偏好,存在信息损失风险。构建过程中的挑战包括:需异步可恢复地写入三种Numpy数组文件(token、ID、logits),确保20B量级数据的一致性;混合数据分布需精细平衡教育、推理与退火阶段的比例,以避免学生模型在特定领域产生偏差;此外,数据源于AI2公开数据并需保留原始许可要求,增加了合规性管理的复杂性。
常用场景
经典使用场景
在自然语言处理与知识蒸馏的交叉领域中,SHADOW-O Logits-20B数据集为轻量级学生模型(如252.8M参数的SHADOW-O)提供了教师模型OLMo-2-0425-1B在2048上下文长度下的稀疏化顶层logits。其经典使用场景集中于以Token级知识迁移为核心的黑箱蒸馏任务,研究者通过捕获每个输入Token对应的Top-16 logits及其概率分布,使学生模型在训练过程中仅需对齐教师模型最具鉴别力的输出子空间,从而在显著降低计算开销的同时维持生成质量。该数据集特有的非归一化logits存储方式支持学生模型在Top-16集合内重新归一化,避免了全词汇表softmax的繁重计算,成为资源受限环境下探索大模型知识压缩范式的关键基准资源。
衍生相关工作
围绕SHADOW-O Logits-20B数据集已衍生出一系列具有影响力的相关工作。基于其稀疏logits存储范式,研究者提出了多种高效蒸馏损失函数,如仅在Top-16上计算的KL散度变体及对比Logits学习损失,以进一步提升学生模型对教师决策边界的逼近能力。同时,该数据集启发了关于‘动态Top-K策略’的研究,即根据输入复杂度自适应调整logits保留数量,从而在冗余信息和关键知识之间取得平衡。另有一些工作利用该数据集的领域混合特性,探索了分阶段蒸馏策略,即在不同训练阶段分别侧重教育文本、代码或推理轨迹的logits对齐,最终显著提升了学生模型在数学推理和多步问答任务上的泛化表现。
数据集最近研究
最新研究方向
当前大模型知识蒸馏的前沿探索中,SHADOW-O Logits 20B数据集聚焦于稀疏化教师信号的传递策略,通过仅存储OLMo-2模型的前16个最高概率令牌的logits值,实现了对学生模型(252.8M参数)的高效引导。这一设计显著降低了传统全分布蒸馏所需的存储与计算开销,同时保留了关键判别信息。伴随开源社区对模型小型化与高效推理的追求,该数据集特别强调教育类、数学推理与代码合成数据的混合配比,反映出行业对可验证性推理能力(如step-by-step逻辑链条)的重视。其20B令牌规模与2TB的紧凑存储格式,标志着面向工业级部署的蒸馏数据工程正从粗糙的指令模仿迈向精细化的概率分布传递,为构建资源友好型的高性能语言模型开辟了新路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务