slm-tokenizer-32k
收藏资源简介:
该数据集是一个专门为小型语言模型(SLM)训练设计的自定义BPE分词器,词汇表大小为32,768个token。分词器基于Qwen/Qwen2.5-Coder-0.5B的正则表达式预分词器规则构建,包含32,700个学习到的token和68个特殊/保留token,无填充token。训练语料为5个领域的平衡混合数据,每个领域最多收集100,000个样本,具体包括:Web数据(来自HuggingFaceFW/fineweb-edu的sample-100BT子集)、合成数据(来自HuggingFaceTB/smollm-corpus的cosmopedia-v2子集)、维基百科(来自HuggingFaceFW/finewiki的en子集)、数学数据(来自HuggingFaceTB/finemath的finemath-4plus子集)以及Python代码(来自rijuludar/stackedu-en的data/python目录)。分词器支持丰富的特殊token结构,涵盖对话标记(如<|im_start|>, <|im_end|>)、FIM标记(如<|fim_prefix|>, <|fim_middle|>, <|fim_suffix|>)、思维链标记(如</think>, </think>)、步骤标记(如<|step_start|>, <|step_end|>)、搜索标记(如<search>, </search>)、工具调用标记(如<tool_call>, </tool_call>, <tool_response>, </tool_response>)以及50个保留标记(<|reserved_0|>到<|reserved_49|>),适用于需要结构化文本处理的小型语言模型训练和推理任务。
本数据集为专为小型语言模型(Small Language Model,SLM)训练打造的自定义字节对编码(Byte Pair Encoding,BPE)分词器,其词汇表规模为32,768个Token。该分词器基于Qwen/Qwen2.5-Coder-0.5B的正则表达式预分词规则构建,包含32,700个学习得到的Token与68个特殊/保留Token,未设置填充Token。 其训练语料为覆盖5个领域的均衡混合数据集,单领域样本采集上限为100,000个,具体领域及对应数据源如下:Web数据(源自HuggingFaceFW/fineweb-edu的sample-100BT子集)、合成数据(源自HuggingFaceTB/smollm-corpus的cosmopedia-v2子集)、维基百科数据(源自HuggingFaceFW/finewiki的en子集)、数学数据(源自HuggingFaceTB/finemath的finemath-4plus子集)以及Python代码数据(源自rijuludar/stackedu-en的data/python目录)。 该分词器支持丰富的特殊Token结构,涵盖对话标记(如<|im_start|>、<|im_end|>)、填充中间(Fill-In-the-Middle,FIM)标记(如<|fim_prefix|>、<|fim_middle|>、<|fim_suffix|>)、思维链(Chain-of-Thought)标记(如</think>、</think>)、步骤标记(如<|step_start|>、<|step_end|>)、搜索标记(如<search>、</search>)、工具调用标记(如<tool_call>、</tool_call>、<tool_response>、</tool_response>)以及50个保留标记(<|reserved_0|>至<|reserved_49|>),可适用于需结构化文本处理的小型语言模型训练与推理任务。
数据集概述:Custom 32k SLM Tokenizer
- 许可证:Apache-2.0
- 语言:英语
- 标签:tokenizer, bpe
核心特征
- 词汇量:总计 32,768 个 token
- 学习到的 tokens:32,700 个
- 特殊/预留 tokens:68 个
- 填充 tokens:0 个
- 算法:BPE(Byte Pair Encoding)
- 预分词器规则:源自
Qwen/Qwen2.5-Coder-0.5B
训练语料
该 tokenizer 在以下 5 个领域的平衡混合数据上训练,每个领域最多收集 100,000 个样本:
| 领域 | 数据集 | 子集/数据目录 |
|---|---|---|
| 网络文本 | HuggingFaceFW/fineweb-edu |
sample-100BT |
| 合成文本 | HuggingFaceTB/smollm-corpus |
cosmopedia-v2 |
| 维基百科 | HuggingFaceFW/finewiki |
en |
| 数学 | HuggingFaceTB/finemath |
finemath-4plus |
| Python 代码 | rijuludar/stackedu-en |
data/python |
特殊 tokens 结构
包含用于结构格式化、推理、工具调用和填充中间(FIM)任务的特殊 tokens:
基本控制 tokens:
<s>、</s>、<|endoftext|>、<|im_start|>、<|im_end|>
FIM tokens:
<|fim_prefix|>、<|fim_middle|>、<|fim_suffix|>
推理与步骤 tokens:
<think>、</think>、<|step_start|>、<|step_end|>
搜索与工具 tokens:
<search>、</search>、<tool_call>、</tool_call>、<tool_response>、</tool_response>
预留 tokens:
<|reserved_0|> 至 <|reserved_49|>(共 50 个)
完整列表:
<s>, </s>, <|endoftext|>, <|im_start|>, <|im_end|>, <|fim_prefix|>, <|fim_middle|>, <|fim_suffix|>, <think>, </think>, <|step_start|>, <|step_end|>, <search>, </search>, <tool_call>, </tool_call>, <tool_response>, </tool_response>, <|reserved_0|> 至 <|reserved_49|>




