遇见数据集

pinkelephant-llm-48b-sft-tokenized

收藏
Hugging Face2026-08-09 更新2026-08-10 收录
官方服务:

资源简介:

Pink Elephant 48B SFT数据集(Tokenized)是用于微调Pink Elephant 48B MoE模型的指令微调语料库,所有样本均已完成预分词处理,可直接用于训练。数据集包含99,661个训练样本和1,000个评估样本,使用Pink Elephant tokenizer(词表大小100,352)进行分词。每条样本包含两个字段:input_ids(List[int32]类型)为分词后的输入序列,labels(List[int64]类型)为目标标记,其中提示部分的位置被掩码为-100。数据构成来自两个公开许可的语料库:49,661条来自self-oss-instruct(sc2-exec)的可执行代码指令,以及50,000条来自OpenR1 Math的数学推理步骤解。数据集经过去重、固定种子随机打乱,并限制序列长度不超过2,048。数据集分为train(99,661条)和eval(1,000条)两个子集。该数据集适用于代码生成和数学推理等指令微调任务。

The Pink Elephant 48B SFT dataset (Tokenized) is an instruction fine-tuning corpus for fine-tuning the Pink Elephant 48B MoE model. All samples are pre-tokenized and ready for training. The dataset contains 99,661 training samples and 1,000 evaluation samples, tokenized using the Pink Elephant tokenizer (vocabulary size 100,352). Each sample contains two fields: input_ids (List[int32] type) is the tokenized input sequence, and labels (List[int64] type) are the target tokens, where the positions corresponding to the prompt are masked with -100. The data comes from two publicly licensed corpora: 49,661 executable code instructions from self-oss-instruct (sc2-exec) and 50,000 mathematical reasoning step solutions from OpenR1 Math. The dataset has been deduplicated, randomly shuffled with a fixed seed, and the sequence length is limited to no more than 2,048. The dataset is split into train (99,661 samples) and eval (1,000 samples) subsets. This dataset is suitable for instruction fine-tuning tasks such as code generation and mathematical reasoning.

创建时间:
2026-08-08
原始信息汇总

Pink Elephant 48B SFT 数据集(已分词)

数据集概述

该数据集是用于微调 Pink Elephant 48B MoE 模型的指令微调语料库,所有样本已使用 Pink Elephant tokenizer(词表大小 100,352)完成分词处理,可直接用于训练,无需额外预处理。

数据集规模

  • 训练样本:99,661 条
  • 评估样本:1,000 条
  • 数据划分:train(99,661 条)、eval(1,000 条)

数据结构

列名 类型 说明
input_ids List[int32] 分词后的输入序列
labels List[int64] 目标 token;提示部分位置以 -100 掩码

数据构成

来源 领域 样本数
self-oss-instruct (sc2-exec) 带可执行解决方案的代码指令 49,661
OpenR1 Math 含逐步解答的数学推理 50,000
总计 99,661

数据来源

数据集基于两个公开、许可宽松的语料库构建,经过去重、固定种子洗牌,并以序列长度 ≤ 2,048 进行分词。原始提示和解答可从 bigcode/self-oss-instructopen-r1/OpenR1-Math 源项目获取。

许可证

MIT 许可证。

搜集汇总
数据集介绍
pinkelephant-llm-48b-sft-tokenized 数据集图片
构建方式
在大规模语言模型指令微调阶段,语料库的构建质量直接决定模型下游任务的表现。Pink Elephant 48B SFT数据集从两个公开且许可宽松的源语料库中整合而来,包含self-oss-instruct(sc2-exec)提供的49,661条代码指令样本与OpenR1 Math提供的50,000条数学推理样本,经过去重、以固定随机种子打乱后,使用Pink Elephant分词器(词表大小100,352)进行序列长度不超过2,048的标记化处理,最终形成总计99,661条训练样本和1,000条评估样本。
使用方法
使用该数据集时,研究者可直接通过Hugging Face datasets库加载训练与评估划分。调用load_dataset函数并指定数据集名称及split参数为train或eval即可获取数据。由于数据已完成标记化与标签对齐,训练流程无需额外预处理,可直接输入至自回归语言模型进行监督微调。加载后的数据对象包含input_ids与labels字段,兼容主流训练框架,如PyTorch与Transformers,显著降低训练前的工程开销。
背景与挑战
背景概述
在指令微调数据成为大语言模型对齐关键资源的背景下,Pink Elephant Limited于2024年前后构建了Pink Elephant 48B SFT数据集,作为Pink Elephant 48B混合专家模型有监督微调的核心语料。该数据集整合了Self-OSS-Instruct代码指令与OpenR1 Math数学推理两个公开许可语料,提供9.9万余条预分词训练样本和1000条评测样本,采用固定词表规模的分词器,序列长度不超过2048。其核心研究问题在于以代码与数学双域混合课程提升模型可执行推理与复杂问题求解能力,并为完全预分词训练流程提供可复现范式。该资源降低了下游微调门槛,对开源大模型在代码生成与数学推理领域的对齐研究与可复现基准建设具有直接参考价值。
当前挑战
该数据集致力于应对大语言模型指令微调中代码可执行性与数学多步推理的联合优化难题,即如何通过混合课程使模型同时习得程序正确性与演绎推理能力。其构建过程亦面临多重现实挑战:将两类异质语料的指令与解答统一至同一分词空间并保持标签掩码语义一致,需要在序列边界与提示掩码处理上精细控制;执行式代码解决方案与数学逐步推导的格式差异要求模板兼容;从公开语料去重、固定种子洗牌到长度截断,每一步均可能引入分布偏置或信息损失;预分词化虽提升训练效率,却使原始文本动态增广与跨分词器迁移受限,对数据治理与评测可比性构成长期考验。
常用场景
经典使用场景
在大语言模型指令微调任务中,该数据集扮演着开箱即用的监督微调语料角色,其经典使用场景聚焦于代码生成与数学推理两大核心能力的联合优化。研究者通常直接加载已分词化的输入序列与掩码标签,以序列长度不超过2048的规范格式启动训练,无需额外预处理即可将模型适配至下游任务。凭借约五万条代码指令与五万条数学推理样本的均衡配比,该数据集支持模型在符号推理与程序合成之间建立协同增益,成为评估微调策略有效性的基准语料之一。
解决学术问题
该数据集有效缓解了指令微调研究中高质量领域语料稀缺与预处理开销高昂的双重困境。通过提供已分词化且标签掩码规范的训练与评估样本,它解决了不同研究之间因数据格式和分词策略差异而导致结果难以复现的问题。同时,代码与数学两个领域的均衡覆盖,为探究模型在结构化推理任务上的迁移学习与灾难性遗忘提供了受控实验条件。其开源许可与明确的来源标注,进一步促进了监督微调方法在学术界的可比较性与可复现性。
实际应用
在实际应用层面,该数据集为中小型研究团队与初创企业提供了快速构建专用代码助手和数学解题引擎的捷径。工程实践中,开发者无需搭建复杂的数据清洗与分词流水线,即可将资源集中于模型架构调优与训练策略设计。对于需要定制化私有模型的场景,该数据集可作为基线语料,配合领域数据继续微调,从而在代码补全、自动化数学证明、教育辅导系统等产品中实现快速原型验证与部署迭代。
数据集最近研究
最新研究方向
在指令微调数据工程日益精细化的背景下,该数据集以预分词形态切入,显著降低了混合专家模型训练前端的计算开销与工程复杂度。其构成融合了可执行代码指令与数学推理链,呼应了当前社区对代码-数学协同泛化能力的探索,即通过两类结构化任务共享表示空间来提升模型的形式化推理与程序合成能力。值得关注的是,此类经固定种子去重与序列截断的语料,正被用于研究数据配比对模型下游性能的边际影响,并为可复现的监督微调基准提供参照。此外,预分词方案亦契合了低资源环境下高效训练与隐私敏感场景中避免原始文本暴露的双重需求,对推动主权语言模型的透明化训练实践具有参考意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务