遇见数据集

c1b-judge-corpus-waveA

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

该数据集是SDAR-30B-A3B模型阶段1的裁判语料库,包含模型自身的验证答案、草稿、训练样本、训练日志和评估记录。数据来自2.24M条提示(涵盖数学、代码、科学、指令遵循和对话),由30B模型生成答案,1.7B草稿模型生成块草稿,并经过裁判模型筛选。数据集结构按目录组织:prompt列表(domain, source, wave, checker key等)、eval集(IFEval-541, FinQA-500, ChartQA-300, chat800)、生成日志(包含kept答案和拒绝原因)、草稿npz文件、训练集(index + items tar)、训练日志(包含配置、probe、replay)、评估记录(checkpoint和probe的每个问题记录)以及分析文件。语料规模总计134.4M tokens(wave A 74.76M tokens / 165,438项,wave B 59.67M tokens / 166,380项,wave B补充代码和随机115K对话子集待添加)。各领域keep rate:数学45%、代码73%、科学20%、指令遵循45%、对话90%。主要结果(128M tokens训练,无专家池化,与原始SDAR-30B对比):GSM8K +1.4、MATH-500 −0.8、MBPP +0.8、HumanEval −3.7、GPQA-Diamond −0.5、AIME −1.1、IFEval −1.7,均在噪声范围内,且每32-token块的MoE次数减少1.30–1.41×;使用DES48专家池化时计算加速更大(1.28–1.42×)但GPQA和IFEval下降。注意:该数据集包含GPQA-Diamond的逐题评估记录(引用了GPQA题目),GPQA作者不允许公开传播纯文本题目,请勿将这些文件用于训练。

The dataset is a judgment corpus for the SDAR-30B-A3B model (phase 1 of the 1B tokens plan), containing the models own validation answers, drafts, training samples, training logs, and evaluation records. The data comes from 2.24M prompts (covering math, code, science, instruction following, and conversation), with answers generated by a 30B model, block drafts generated by a 1.7B draft model, and filtered by a judgment model. The dataset is structured by directories: prompt lists (domain, source, wave, checker key, etc.), eval sets (IFEval-541, FinQA-500, ChartQA-300, chat800), generation logs (containing kept answers and rejection reasons), draft npz files, training set (index + items tar), training logs (containing configuration, probe, replay), evaluation records (each problem record for checkpoint and probe), and analysis files. The corpus totals 134.4M tokens (wave A 74.76M tokens/165,438 items, wave B 59.67M tokens/166,380 items, wave B supplementary code and random 115K conversation subset to be added). Domain keep rates: math 45%, code 73%, science 20%, instruction following 45%, dialogue 90%. Main results (128M tokens training, no expert pooling, compared to original SDAR-30B): GSM8K +1.4, MATH-500 −0.8, MBPP +0.8, HumanEval −3.7, GPQA-Diamond −0.5, AIME −1.1, IFEval −1.7, all within noise range, with MoE calls per 32-token block reduced by 1.30–1.41×; with DES48 expert pooling computation speedup is larger (1.28–1.42×) but GPQA and IFEval degrade. Note: this dataset contains per-problem evaluation records for GPQA-Diamond (citing GPQA problems). The GPQA authors do not allow public dissemination of plain-text problems; do not use these files for training.

创建时间:
2026-09-28
原始信息汇总

数据集概述

基本信息

  • 数据集名称:Phase 1 judge corpus for SDAR-30B-A3B (1B-token plan) — corpus, logs and evals
  • 许可证:other
  • 标签:block-diffusion, speculative-decoding, moe, sdar
  • 相关资源:
    • 代码:GitHub phase1-datacorpus
    • 权重:Arushhh/c1b-judge-lora-sdar30b-b32

数据内容

包含 30B 模型对 224 万条提示(数学、代码、科学、指令跟随、聊天)的自身校验答案、1.7B drafter 的 block drafts、由它们构建的训练条目、所有训练日志与探针,以及所有评估记录。

一次性获取全部内容(代码 + 本数据集 + 权重,布局与训练机器一致):从 GitHub 仓库执行 bash code/corpus1b/ops/retrieve_all.sh(参见其中的 RETRIEVE.md)。

目录布局(路径镜像仓库根目录)

路径 内容
data/c1b/prompt_lists/<domain>.jsonl 224 万条提示(pid、domain、source、wave A/B、checker key、meta);postdecontam_*.json 为后期去污染
data/c1b/eval/ 评估集(IFEval-541、FinQA-500、ChartQA-300、chat800)
logs/c1b/gen/wave{A,B}/gpu<k>/ records.*.jsonl.gz(保留答案带 prompt_ids + 32-token blocks;被拒答案保留原因)、done.txt、stats.jsonl
logs/c1b/draft/wave{A,B}/gpu<k>/ drafter block drafts(drafts.*.npz)
logs/c1b/trainset/wave{A,B}/ index.jsonl + items_tar/<h2>.tar(→ items/<h2>/*.npz);index_128m.jsonl(合并,使用 28.5M→128M)、holdout_pids_waveA.txt(固定探针集)
logs/c1b/train/<run>/ main(0→28.5M tokens)、main_128m(28.5M→128M):train.rank*.jsonl、probe.jsonl、config.json、已见数据回放/报告
logs/c1b/eval/checkpoint*/、probe128M/、aime4k/ 每个评估检查点与设置的逐题记录 + summary.md/json
logs/c1b/analysis/ GPQA teacher-forced probe(28.5M vs 128M)
logs/c1b/dl/、logs/c1b/*.log 精确的运维脚本与运行日志

语料规模(语料 tokens = prompt + 保留答案)

  • Wave A:74.76M(165,438 items)
  • Wave B(科学 + IF 完成,数学/聊天部分完成):59.67M(166,380 items)
  • 合计:134.4M
  • 正在添加 wave-B 代码 + 随机 115K 聊天子集(2026-09-30/10-01)
  • 保留率:数学 45%、代码 73%、科学 20%、IF 45%、聊天 90%
  • 已针对 GSM8K、MATH、MATH-500、AIME、GPQA、HumanEval、MBPP、IFEval 去污染(独立审计未发现重叠)

主要结果(judge 在 128M tokens,无 expert pooling,与 stock SDAR-30B 配对比较)

  • GSM8K 91.6 (+1.4)
  • MATH-500 71.6 (−0.8)
  • MBPP 66.1 (+0.8)
  • HumanEval 74.4 (−3.7)
  • GPQA-Diamond 36.9 (−0.5)
  • AIME 5.6 (−1.1)
  • IFEval 51.0 (−1.7)

均在 stock 的噪声范围内,每 32-token block 的 MoE passes 减少 1.30–1.41×。使用 DES48 expert pooling 时计算加速更大(1.28–1.42×),但 GPQA(−7.1)和 IFEval(−14.6)下降。详情见 GitHub 上的 docs/results/phase1/nopool_vs_des48_128M.md。

注意事项

本仓库包含逐题 GPQA-Diamond 评估记录(模型答案引用了 GPQA 问题),应所有者要求发布。GPQA 作者要求其示例不要以纯文本形式转发;请勿在这些文件上训练。

搜集汇总
数据集介绍
c1b-judge-corpus-waveA 数据集图片
构建方式
在块扩散与投机解码交织的MoE架构探索中,该数据集以模型自判为核心机制,由SDAR-30B-A3B-Chat-b32对涵盖数学、代码、科学、指令跟随及对话的224万条提示生成经校验的答案,同时以1.7B草稿模型产出块级草稿,再据此构建训练项。语料经独立审计去污染,与GSM8K、MATH、AIME、GPQA、HumanEval等基准零重叠,总规模达1.344亿词元,并保留拒绝原因与完整生成日志。
特点
数据集呈现多层级、细粒度的结构化特征,囊括提示清单、评测集、生成记录、草稿块、训练条目及逐检查点评估结果,并以域别保留率揭示筛选强度:数学45%、代码73%、科学20%、指令跟随45%、对话90%。其突出价值在于配对比较设计,可量化128M词元判定器相对原版SDAR-30B的精度波动与每32词元块1.30至1.41倍的MoE通过缩减,且附带专家池化对照分析。
使用方法
使用者可借助GitHub仓库的retrieve_all.sh脚本将代码、数据集与权重按训练环境布局一键聚合,继而按路径索引加载提示、草稿与训练项。训练日志与探针记录支持复现0至28.5M及28.5M至128M词元的迭代轨迹,评测汇总则便于逐检查点比对。需注意GPQA-Diamond逐题记录含原题引用,依作者要求不得以明文重发或用于训练。
背景与挑战
背景概述
在稀疏专家混合与块扩散解码交汇的前沿,SDAR-30B-A3B模型虽以高效推理见长,却长期缺乏对其自身生成答案进行批判性筛选的大规模语料。2026年前后,NoviceCoderInfinity团队构建了c1b-judge-corpus-waveA,旨在通过模型自判机制从2.24M条数学、代码、科学及指令遵循提示中提炼高质量训练信号。该数据集覆盖134.4M词元的提示与保留答案,辅以1.7B草稿模型的块级草稿及完整训练日志,为推测解码与专家混合架构的协同优化提供了可复现的基准,其发布推动了自蒸馏与推理加速领域的实证研究。
当前挑战
该数据集所应对的核心领域问题在于,如何在不显著牺牲生成质量的前提下,降低MoE模型逐块解码的计算开销。构建中遭遇多重挑战:多领域答案的自动判选需平衡保留率与噪声,数学与科学提示的保留率分别低至45%与20%,而代码与聊天则高达73%与90%;草稿模型与目标模型间的块对齐要求精细的32词元分块与专家池化策略。此外,去污染审计虽未发现与GSM8K、MATH等基准的重叠,但GPQA示例的明文收录引发了数据再分发与训练合规的伦理争议。
常用场景
经典使用场景
在块扩散(block-diffusion)与投机解码(speculative decoding)融合的前沿探索中,c1b-judge-corpus-waveA 扮演着评判语料与验证基座的双重角色。该数据集汇聚了 SDAR-30B-A3B-Chat-b32 对 224 万条提示(涵盖数学、代码、科学、指令遵循与对话)的经校验答案,以及 SDAR-1.7B 草稿模型生成的块级草稿,构成训练与评估闭环的核心素材。研究者依托其可复现的训练项、探针与评估记录,系统检验 30B 专家混合模型与轻量草稿器之间的协同机制,尤其关注在维持原生性能的前提下,每 32 token 块所需的 MoE 前向次数能否显著压缩,从而为稀疏激活架构的高效推理提供经典实验范式。
解决学术问题
该数据集直面大模型推理效率与输出质量之间长期存在的张力,通过提供 1.34 亿 token 的评判语料及配套的 2850 万至 1.28 亿 token 分阶段训练记录,使得以下学术问题得以严谨回答:块扩散草稿能否在不损失数学、代码、科学推理与指令遵循能力的情况下,降低专家混合模型的推理开销;专家池化策略对精度—速度权衡产生何种影响。经 GSM8K、MATH-500、MBPP、HumanEval、GPQA-Diamond、AIME 与 IFEval 的去污染评估,该数据集揭示了无池化条件下性能与基线持平且 MoE 通过次数减少 1.30–1.41 倍的事实,为稀疏架构的效率边界提供了可信基准,对模型加速与部署研究具有实质推动作用。
衍生相关工作
c1b-judge-corpus-waveA 作为第一阶段评判语料的公开载体,已催生若干紧密关联的经典工作。其配套权重 Arushhh/c1b-judge-lora-sdar30b-b32 提供了经 LoRA 微调的 SDAR-30B 评判模型,构成后续比较研究的基准;GitHub 仓库 phase1-datacorpus 中的检索脚本与结果文档,支撑了无池化与 DES48 池化在 GPQA 与 IFEval 上的系统对比,揭示了精度与加速之间的权衡细节。此后,块扩散草稿与专家混合模型的联合训练范式被进一步拓展至更大 token 预算(如 128M 至 1B)的规划中,而 28.5M 与 128M 检查点的探针记录亦为持续学习与数据回放策略提供了可复用的实验基线,逐步形成以评判语料驱动高效推理研究的衍生脉络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务