遇见数据集

sleepyeldrazi/qwen3.6-27b-self-data-distillation-dataset

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

通过运行**Qwen3.6‑27B**(通过vLLM)生成的单轮推理轨迹。每个轨迹包含一个系统提示、一个用户任务以及模型的完整输出(包括嵌入在助手`content`字段中的推理步骤)。

Single‑turn reasoning trajectories generated by running **Qwen3.6‑27B** (via vLLM). Each trajectory contains a system prompt, a user task, and the models full output (including reasoning steps embedded in the assistant `content` field).

提供机构:
sleepyeldrazi
搜集汇总
数据集介绍
构建方式
该数据集基于Qwen3.6-27B大语言模型,通过自我数据蒸馏技术生成单轮推理轨迹。构建过程中,模型在vLLM推理框架下以温度0.7、最大输出令牌数16384进行采样,并发数为256。数据涵盖数学、世界知识、编程与智能体任务四大类别,其中数学类题目来源于OpenMathReasoning数据集,世界知识类基于Jeopardy试题及Tier1问题,编程与智能体任务则融合了Tier1数据和人工生成的场景。最终以JSONL格式存储,每条记录包含系统提示、用户任务、模型完整输出及令牌统计信息。
使用方法
本数据集适用于监督微调与推理能力增强任务,可直接用于训练大语言模型的单轮对话与推理能力。使用时,将JSONL文件加载为对话格式,通过读取'messages'字段中的角色轮次构建训练样本,其中系统提示统一为'You are a helpful AI assistant.'。研究者可依据类别进行针对性训练,例如使用数学类数据强化推理长度,利用智能体类数据提升工具调用能力。数据集采用Apache 2.0许可,便于学术与商业场景下的灵活使用。
背景与挑战
背景概述
在大语言模型推理能力的研究进程中,自我蒸馏作为一种高效的知识传递范式正日益受到关注。该数据集由Qwen团队于近期创建,基于Qwen3.6-27B模型,通过自蒸馏策略生成涵盖数学推理、世界知识、代码编写与智能体任务四大类别的单轮推理轨迹。数据集中数学轨迹平均长度达10.6K tokens,充分展现了模型在复杂推理过程中的细粒度思维链。作为合成数据集,其构建旨在为后续模型训练、对齐与推理能力增强提供高质量的监督信号,在促进开源大模型推理透明性与可复现性方面具有重要研究价值。
当前挑战
该数据集所应对的领域挑战在于:缺乏大规模、结构化的开放式推理轨迹以支撑模型的深度推理训练,尤其在需要多步逻辑推导的数学与代码任务中尤为突出。构建过程中则面临多重困难:其一,需确保生成轨迹的语义连贯性与逻辑自洽性,避免模型在此过程中产生幻觉或推理断裂;其二,跨类别数据的分布不均衡,如数学样本仅占9.1%,但其token占比却高达21.4%,这要求在采样策略上实现合理权衡;其三,在16K token的上限下,长序列推理的稳定输出对模型配置与并发生成提出了严格要求。
常用场景
经典使用场景
在大型语言模型的训练与优化领域,Qwen3.6-27B自数据蒸馏轨迹数据集为单轮推理轨迹的生成与评估提供了标准化基准。该数据集通过Qwen3.6-27B模型在vLLM框架下以温度0.7、最大16,384 tokens的设定生成,涵盖数学、世界知识、编程与智能体四大类别,共计4,399条高质量轨迹。每条数据包含完整的系统提示、用户任务及模型输出,尤其保留了详细的推理步骤,使其成为解析大模型思维链过程的理想素材。
解决学术问题
该数据集有效回应了当前大语言模型研究中长期存在的推理过程透明化与可复现性不足的困境。数学类别中平均10,641 tokens的详细推理链条,为研究长程逻辑推演及中间步骤质量提供了分析窗口;而世界知识与编程类别则可用于探究知识型问答与结构化任务中的模型表征差异。通过公开4,399条涵盖多领域的轨迹,该数据集助力学界深入理解自我蒸馏机制如何压缩模型的知识表征并保持推理质量,从而推动模型部署效率与精度平衡的理论发展。
实际应用
在工程落地层面,该数据集为智能客服、代码辅助开发及自动化决策系统等场景提供了可复用的训练与评测资源。智能体类别中的1,400条工具使用轨迹可直接用于训练模型掌握API调用与多步规划能力;世界知识类别的多样化问题则适用于知识检索增强系统的校准。借助Apache 2.0许可证,开发者能够自由将此数据集整合至自有训练管线,加速模型在真实业务场景中的推理鲁棒性与任务适应性优化。
数据集最近研究
最新研究方向
该数据集聚焦于利用Qwen3.6-27B大语言模型进行自我数据蒸馏生成单轮推理轨迹,涵盖数学、世界知识、编程与智能体四大前沿领域。其中,数学类轨迹平均含1万余词元,展现深度逐步推理能力,与当前大模型在复杂数学推理(如竞赛级问题求解)中的热点研究高度契合;智能体类轨迹则面向工具调用场景,反映了模型自主规划与交互能力的最新进展。数据通过vLLM高效生成,采用低温采样策略,确保了多样性与连贯性。这一技术路径为缓解高质量标注数据稀缺问题提供了新范式,尤其在推理密集型任务中,自我蒸馏免去了对人工标注的依赖,显著提升数据生成效率与模型自改进潜力。其开源属性(Apache 2.0)与多类别设计,为后续研究者在指令微调、思维链蒸馏及智能体行为泛化等方向提供了坚实的数据基础设施,对推动大语言模型在知识密集型与交互式场景下的实用化具有重要启发意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务