遇见数据集

thinkingcap-sft-qwen38-27b

收藏
Hugging Face2026-08-24 更新2026-08-25 收录
官方服务:

资源简介:

ThinkingCap SFT+DPO Qwen3.8-27B是一个高效的推理数据集,用于训练模型进行token高效思考。该数据集的构建方式与BottleCap的ThinkingCap-Qwen3.6-27B相同,但通过on-policy方式从实时运行的Qwen3.8-27B-abliterated-MTP模型(服务端口:8090/:8091,温度1.0)收集,并经过独立重新计算的oracle验证(正确性由构造保证,而非依赖生成器存储的答案)。数据集包含400个问题,涵盖12个可验证领域,共1350个on-policy样本(每个问题3个样本,温度1.0,两个GPU分片),其中84.2%(1137/1350)被oracle验证为正确。SFT部分包含369行,每个问题选取最短的正确推理;DPO/ORPO部分包含244对,chosen为短正确推理,rejected为长正确推理,平均效率比2.0倍(最高11.2倍)。数据集使用方法:SFT数据(tc_upload_sft.jsonl)采用ChatML格式,每个assistant轮次包含reasoning_content(短且自信)和content,用于学习高效思考风格;DPO/ORPO数据(tc_upload_dpo.jsonl)包含prompt/chosen/rejected,两者均正确但chosen更短,直接教导token效率。此外,数据集提供了每个领域的oracle正确率,例如代数100%、序列100%、代码99.0%、逻辑91.5%、比率85.5%、数论77.4%、组合数学61.9%。数据集基于Qwen3.8-27B-abliterated-mtp-Q6_K模型构建,oracle由独立解析器从问题文本重新计算得出(而非依赖生成器存储的答案)。

ThinkingCap SFT+DPO Qwen3.8-27B is an efficient reasoning dataset for training models to think token-efficiently. It contains 400 problems across 12 verifiable domains, with 1350 on-policy samples (3 samples per problem), of which 84.2% are verified correct by an oracle. The SFT part includes 369 rows, each selecting the shortest correct reasoning per problem; the DPO/ORPO part includes 244 pairs, with chosen being short correct reasoning and rejected being long correct reasoning, achieving an average efficiency ratio of 2.0x. The dataset is built based on the Qwen3.8-27B-abliterated-mtp-Q6_K model, collected via on-policy methods and independently verified by an oracle.

创建时间:
2026-08-24
原始信息汇总

数据集概述

ThinkingCap SFT+DPO — Qwen3.8-27B 是一个面向高效推理(token-efficient reasoning)的文本生成数据集,基于 Qwen3.8-27B 模型,采用策略内采样(on-policy)与独立验证(oracle-verified)方式构建。

基本信息

  • 许可证: Apache 2.0
  • 任务类别: 文本生成(text-generation)
  • 基础模型: Qwen3.8-27B-abliterated-mtp-Q6_K
  • 相关模型: hotdogs/Qwen3.8-27B-thinkingcap-abliterated-preview 及其 MTP GGUF 版本

数据规模

  • 问题数量: 400 个(覆盖 12 个可验证领域)
  • 策略内样本: 1350 条(每个问题 3 条,温度 1.0,来自双 GPU 分片)
  • Oracle 验证正确率: 84.2%(1137/1350)
  • SFT 行数: 369 条 —— 每个问题的最短正确推理
  • DPO/ORPO 对: 244 对 —— chosen 为短正确,rejected 为冗长正确
    • chosen 推理平均长度: 342 字符(p90: 607)
    • rejected 推理平均长度: 721 字符(p90: 1634)
    • 平均效率比: 2.0 倍(最高达 11.2 倍)

数据结构与用途

  • SFT 文件 (tc_upload_sft.jsonl): ChatML 格式,每个 assistant 轮次包含 reasoning_content(简短、自信)和 content,用于训练高效思考风格。
  • DPO/ORPO 文件 (tc_upload_dpo.jsonl): 包含 prompt / chosen / rejected 三元组,chosen 与 rejected 均正确,但 chosen 更短,直接教授 token 效率。

各领域 Oracle 正确率(独立重算)

领域 正确数/总数 正确率
代数 (algebra) 234/234 100.0%
序列 (sequences) 114/114 100.0%
代码 (code) 104/105 99.0%
逻辑 (logic) 97/106 91.5%
比率 (rates) 100/117 85.5%
数论 (number_theory) 353/456 77.4%
组合数学 (combinatorics) 135/218 61.9%

较难的领域原始准确率较低,因此提供更多 DPO 对比信号。

构建来源

  • 基础模型: Qwen3.8-27B-abliterated-mtp-Q6_K-mixed(7×3090 显卡,GPUs 1-2 与 3-4)
  • 阶段 A 基线(温度 1.0): 简单 ~236 / 中等 ~1862 / 困难 ~2014 思考字符
  • Oracle 由独立解析器从问题文本重新计算(非生成器存储的答案),因此正确性由构造保证。此方法曾捕获并修复一个质数和 off-by-one 错误(模型回答 1032 实际正确,而原始答案库为 1133)。
搜集汇总
数据集介绍
thinkingcap-sft-qwen38-27b 数据集图片
构建方式
该数据集基于Qwen3.8-27B-abliterated-mtp模型,采用on-policy采样策略,在7块3090 GPU上并行生成,每个问题采集3个推理样本,共400个问题覆盖12个可验证领域,累计1350个样本。所有样本均通过独立解析器重新计算Oracle结果进行验证,确保正确性不依赖于生成器的存储答案。最终筛选出369条SFT数据,每个问题选取最短正确推理,并构建244对DPO/ORPO对,其中chosen为短正确推理,rejected为长正确推理,以强化token高效性。
特点
数据集的核心特点在于其高效推理导向,SFT数据平均思考长度较基线显著缩短,DPO对的chosen与rejected思考长度均值比达2.0倍,最大可达11.2倍,直接体现效率差异。各领域正确率从100%到61.9%不等,难度较高的领域提供更强的DPO对比信号。通过独立Oracle验证,避免了生成器存储答案的潜在错误,如修复了素数求和越界问题,确保了数据质量的可靠性和稳健性。
使用方法
数据集提供两种使用方式:SFT部分采用ChatML格式,每个assistant轮次包含简短的reasoning_content和content,用于训练模型习得高效思考风格;DPO/ORPO部分提供prompt/chosen/rejected三元组,其中chosen和rejected均为正确但长度不同,可训练模型偏好更简洁的推理链条。用户可直接加载JSONL文件,分别用于监督微调和偏好优化,以提升模型的token利用效率和推理能力。
背景与挑战
背景概述
ThinkingCap SFT+DPO Qwen3.8-27B数据集由hotdogs团队于近期构建,旨在提升大语言模型在推理任务中的token效率。该数据集基于Qwen3.8-27B模型,采用on-policy采样与独立验证的oracle机制,确保数据正确性。其核心研究问题是通过SFT与DPO/ORPO训练,使模型学习生成更简洁、高效的推理过程,同时保持答案的准确性。该数据集在推理效率优化领域具有开创性,为后续研究提供了可复现的基准和方法论。
当前挑战
该数据集面临的挑战包括:1)领域问题:大语言模型在生成推理链时往往冗长且冗余,导致计算资源浪费和响应延迟,如何在不损失准确性的前提下实现token高效推理是核心难点;2)构建过程:收集的on-policy样本中,oracle验证正确率仅84.2%,且不同领域正确率差异大(如组合数学仅61.9%),导致DPO对比信号强度不均;同时,需对每个问题独立重算oracle以避免生成器的存储错误,增加了构建复杂度,如曾发现质数和问题的边界错误并修正。
常用场景
经典使用场景
ThinkingCap SFT+DPO Qwen3.8-27B数据集专为提升大语言模型推理效率而设计,其经典使用场景聚焦于监督微调与偏好对齐。研究者可基于其SFT部分(含369条最短正确推理样本)训练模型习得简洁、自信的思考风格;同时利用DPO/ORPO部分(含244对偏好数据)通过对比短正确与冗长正确推理,直接优化模型对token效率的偏好。该数据集覆盖代数、序列、代码、逻辑等12个可验证领域,为评估模型在多样化推理任务中的效率提升提供了标准化基准。
实际应用
在实际应用中,该数据集可用于优化生产环境下的语言模型推理服务,显著降低API调用延迟与算力开销。例如,在实时问答、代码生成、数学解题等场景中,训练后的模型能更快给出正确答案,提升用户体验并节约资源。此外,其DPO训练策略适用于模型压缩与蒸馏场景,可在不牺牲性能的前提下减少模型推理时的显存占用,为边缘设备部署或大规模并发服务提供支持。
衍生相关工作
该数据集衍生了多项经典工作,包括基于其SFT数据训练的ThinkingCap系列模型(如Qwen3.8-27B-thinkingcap-abliterated-preview),这些模型展示了高效推理能力的可迁移性。其DPO/ORPO数据启发了后续关于偏好优化奖励设计的研究,例如如何更有效地在正确性与简洁性间权衡。此外,数据集的oracle验证方法促进了自动化推理验证工具的发展,影响了后续数据集构建中答案可信度的评估标准,成为相关领域引用与对比的基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务