遇见数据集

whittle-teacher32-complete-answers

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

Whittle teacher32: complete answers with per-token teacher logprobs 是一个用于知识蒸馏研究的数据集,作为 Whittle 压缩项目的一部分。该数据集由教师模型 Qwen3.8-27B(通过 llama.cpp 以 UD-Q5_K_XL 量化版本运行)生成的完整答案组成,每个答案在生成每个位置时捕获了教师模型的 top-32 logprobs。数据集的目的是训练学生模型理解答案何时完成,以避免重复并学习内容条件化的停止行为。数据集包含多个家族:enum(25个提示×2个种子,生成编号列表)、short(14个提示×2个种子,单句答案)、medium(8个提示×2个种子,自然长度解释)、code(5个提示×2个种子,代码块答案)、convo(8个脚本×2个种子,5-6轮对话,包含枚举请求)、extra(70个提示×1个种子,结构化输出如SQL、HTML、markdown表格、JSON)。所有提示与评估集不相交。最终计数为245行(enum 44, short 40, medium 12, code 8, extra 45, convo 96),包含178k教师目标token。已知缺陷:3行因写入中断丢失,控制台日志未保存,部分超长结构化提示因超出4096 token预算被跳过。Extra家族中少于400答案token的为教师 stub 模式响应,建议在蒸馏训练前过滤。数据格式包括 JSONL 文件(每行包含 key, family, prompt|convo, seed, input_ids, spans, idx, val),其中 spans 表示助手答案的 token 范围,idx/val 是每个位置 top-32 教师 token ID 和 logprobs。NPZ 文件提供训练缓存。教师模型使用 temperature 0.6, top_p 0.9, top_k 40, 固定种子。许可证为 Apache 2.0。

Whittle teacher32: complete answers with per-token teacher logprobs is a dataset for knowledge distillation research, as part of the Whittle compression project. The dataset consists of complete answers generated by the teacher model Qwen3.8-27B (run via llama.cpp in UD-Q5_K_XL quantization), capturing the top-32 logprobs from the teacher model at each token position. The goal is to train student models to understand when an answer is complete, to avoid repetition and learn content-conditioned stopping behavior. The dataset includes multiple families: enum (25 prompts × 2 seeds, generating numbered lists), short (14 prompts × 2 seeds, single-sentence answers), medium (8 prompts × 2 seeds, natural-length explanations), code (5 prompts × 2 seeds, code block answers), convo (8 scripts × 2 seeds, 5-6 turn dialogues including enumeration requests), and extra (70 prompts × 1 seed, structured outputs like SQL, HTML, markdown tables, JSON). All prompts are disjoint from the evaluation set. The final count is 245 rows (enum 44, short 40, medium 12, code 8, extra 45, convo 96), containing 178k teacher target tokens. Known issues: 3 rows lost due to write interruption, console logs not saved, some very long structured prompts skipped due to exceeding 4096 token budget. Extra family answers with fewer than 400 answer tokens are teacher stub mode responses; it is recommended to filter them before distillation training. Data format includes JSONL files (each line contains key, family, prompt|convo, seed, input_ids, spans, idx, val) where spans indicate token ranges of assistant answers, and idx/val are top-32 teacher token IDs and logprobs at each position. NPZ files provide training cache. The teacher model uses temperature 0.6, top_p 0.9, top_k 40, with fixed seeds. License: Apache 2.0.

创建时间:
2026-08-21
原始信息汇总

Whittle teacher32: 完整答案与逐词元教师对数概率数据集

数据集概览

本数据集属于 Whittle 压缩项目(研究预览版),由个人研究项目自筹资金支持。该数据集旨在解决知识蒸馏中的一个关键问题:压缩学生模型缺少“答案何时完成”的信号。

核心内容

数据集包含由 Qwen3.8-27B(UD-Q5_K_XL 量化版,通过 llama.cpp 推理)生成的完整答案,每个答案均以真实结束词元(EOS)结尾,并记录了每个生成位置的教师模型 top-32 对数概率(logprobs),用于训练学生模型学习何时停止生成。

数据家族

家族 规模 用途
enum 25 提示词 × 2 种子 编号列表(以第 N 项结尾)
short 14 × 2 单句答案,早期停止锚点
medium 8 × 2 自然长度的解释
code 5 × 2 围栏代码答案
convo 8 脚本 × 2 种子 5-6 轮对话,包含后期轮次枚举请求(已测量的失败场景)
extra 70 × 1 结构化输出(SQL、HTML、Markdown 表格、JSON),来自真实失败提示

所有提示词均与评估集不重叠。未在 token 预算内以干净 EOS 结束的行被跳过并记录,不会存入数据。

最终统计(2026年8月21日)

  • 总行数:245 行(enum 44、short 40、medium 12、code 8、extra 45、convo 96,每行对应一个助手回答轮次)
  • 上下文长度:最高 6.4k tokens
  • 教师目标 tokens 总数:178k
  • 已知瑕疵:3 行因中途写入错误丢失(已从修复的 jsonl 重建 npz);生成控制台日志未存留;少量超长结构化提示在 4096-token 预算内未结束,被跳过而非截断。extra 家族中低于 400 答案 token 的行属于教师 stub 模式响应,应在蒸馏训练前过滤。

文件格式

  • teacher_complete.jsonl:每行一个答案或对话,包含字段 {key, family, prompt|convo, seed, input_ids, spans, idx, val}spans 为助手答案的 [start, end) token 区间;idx/val 为每个位置 top-32 教师 token id 和对数概率(位置 p 对应生成 token p+1 的分布;助手区间外的位置为垃圾填充,需掩码)。
  • teacher_complete.npz:训练器缓存(row_ids, lengths, idx, val, topk)
  • gen_teacher_v2.py:精确生成脚本(用于溯源)
  • extra_prompts.json:收集的结构化输出提示

教师模型与生成参数

  • 教师模型:Qwen/Qwen3.8-27B(Unsloth UD-Q5_K_XL GGUF),由 llama.cpp 服务,禁用思维链
  • 对数概率:全词汇表采样前 softmax,每位置 top-32,在相同生成调用中捕获
  • 采样参数:温度 0.6、top_p 0.9、top_k 40,固定种子

许可证

Apache 2.0(与教师模型许可证一致)。提示词为项目原创或为其早期 on-policy 采集生成。

搜集汇总
数据集介绍
whittle-teacher32-complete-answers 数据集图片
构建方式
数据集Whittle teacher-complete answers由个人研究项目倾力打造,依托Qwen3.8-27B教师模型(UD-Q5_K_XL量化版)经由llama.cpp引擎生成完整回答,并在每个生成位置捕获教师模型的前32个logprobs。构建过程精心设计了六个家族(enum、short、medium、code、convo、extra),涵盖枚举列表、单句答案、自然长度解释、代码块、多轮对话及结构化输出,各家族基于不同提示词与种子数生成,确保多样性与代表性。所有提示词均与评估门禁无重叠,生成过程中严格筛选,仅保留以干净结束符(EOS)终止的回答,越界或异常行则跳过并记录,以确保数据纯净性。最终数据集包含245行,共178k教师目标词元,并附带生成脚本、提示词文件及训练缓存,保障了构建的透明性与可复现性。
特点
该数据集的核心特色在于其精准捕捉‘回答完整性’这一在知识蒸馏中易被忽视的信号,基于五轮研究揭示了压缩学生模型缺失的结束时机。所有回答均自然终止于真实的回合结束符,避免了长度先验的误导。数据集结构清晰,每行记录包含提示词、种子、输入词元ID、助手回答跨度及逐位置的前32个教师词元ID与logprobs,便于精细对齐。families设计覆盖广泛场景,尤其聚焦于多轮对话晚轮枚举请求等易失败环节。已知瑕疵如实记录,如行丢失与超长提示跳过,确保了数据披露的诚实性。此外,数据集与评估提示完全隔离,增强了训练-评估的公正性。
使用方法
使用本数据集时,需从HuggingFace仓库下载`teacher_complete.jsonl`文件,按需解析每条记录中的`spans`字段以确定助手回答的词元范围,并仅在该范围内利用`idx`和`val`中的top-32 logprobs进行蒸馏训练,位置p的分布对应生成token p+1,范围外须实施掩码。可选加载`teacher_complete.npz`训练缓存以加速过程。特别建议,筛选`extra`家族中回答词元数低于400的行排除(因其为教师桩模式响应),依据研究建议设置蒸馏目标。由于许可证为Apache 2.0,可在遵守条款下自由使用与修改。详细方法论与设计权衡参考模型仓库中的`WHITTLE_FINDINGS.md`文档。
背景与挑战
背景概述
该数据集诞生于2026年8月,源自Whittle压缩战役,是一项个人研究项目,由David A. 发起并自筹资金。其核心目标在于解决知识蒸馏中压缩学生模型对答案完成时机信号缺失的问题。通过利用Qwen3.8-27B教师模型(UD-Q5_K_XL量化版)生成的完整回答,并捕获每个位置的top-32对数概率,该数据集为训练学生模型提供了丰富的细粒度监督信号。其设计严格遵循研究发现的结论,修正了早期评估提示泄露和长度先验偏差等问题,对知识蒸馏领域具有方法论上的参考价值,尤其为压缩模型在何时停止生成提供了关键训练依据。
当前挑战
该数据集面临的挑战包括多维度。首先,其旨在解决的领域问题是语言模型在压缩后常丢失答案完整性的判断能力,导致过早或过晚停止生成,影响输出质量。其次,构建过程中遇到诸多难题:生成环境稳定性不足,导致3行数据因写入中断而损坏;部分超长结构化提示在4096 token预算内无法正常结束,被跳过而非截断,可能引入数据偏差;此外,评估提示曾混入训练列表,需通过严格审计确保数据纯净性,同时需过滤教师模型在短答案模式下的过渡响应,以保持蒸馏训练的有效性。
常用场景
经典使用场景
该数据集作为知识蒸馏领域的精细标注资源,专为训练学生模型捕捉教师模型在回答终止时的判定信号而设计。其核心应用场景是监督式序列生成任务,特别是那些需要模型自主判断生成何时结束的文本生成场景,如对话系统、代码补全和结构化输出生成。通过提供每个位置的全词汇表top-32对数概率,该数据集使研究者能够训练学生模型不仅模仿内容,更学习教师模型的停止决策,从而解决压缩模型在停止时机上常见的过生成或欠生成问题。
衍生相关工作
该数据集源自一项五轮压缩研究,其发现已整理为Whittle压缩运动的一部分。相关衍生工作包括:基于此数据集训练的学生模型性能评估,探索不同压缩率下停止信号的可迁移性;对数据集设计缺陷(如评估提示泄露、长度先验)的修正方法研究;以及针对超长结构化输出的专门蒸馏策略。这些工作共同推动了知识蒸馏领域对序列级信号的理解,并为后续研究提供了方法论参考。
数据集最近研究
最新研究方向
该数据集聚焦于知识蒸馏中关键的‘回答结束时刻’信号,致力于压缩学生模型对内容条件性终止的缺失建模。通过捕获教师模型(Qwen3.8-27B)在每个生成位置上的top-32对数概率,提供了细粒度监督,以纠正长篇幅有偏和评估提示泄漏问题。研究前沿包括利用无思考模式下的完整答案序列,结合多类别提示族(枚举、短答、代码、对话等),探索如何在蒸馏中保留何时停止的语义边界,从而提升小模型在结构化输出和低延迟场景下的完成度与忠实性。此工作呼应了针对大模型推理效率的压缩浪潮,为构建更精准、防重复的微型会话代理提供了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务