c1b-judge-corpus-waveA
收藏资源简介:
该数据集是SDAR-30B-A3B模型阶段1的裁判语料库,包含模型自身的验证答案、草稿、训练样本、训练日志和评估记录。数据来自2.24M条提示(涵盖数学、代码、科学、指令遵循和对话),由30B模型生成答案,1.7B草稿模型生成块草稿,并经过裁判模型筛选。数据集结构按目录组织:prompt列表(domain, source, wave, checker key等)、eval集(IFEval-541, FinQA-500, ChartQA-300, chat800)、生成日志(包含kept答案和拒绝原因)、草稿npz文件、训练集(index + items tar)、训练日志(包含配置、probe、replay)、评估记录(checkpoint和probe的每个问题记录)以及分析文件。语料规模总计134.4M tokens(wave A 74.76M tokens / 165,438项,wave B 59.67M tokens / 166,380项,wave B补充代码和随机115K对话子集待添加)。各领域keep rate:数学45%、代码73%、科学20%、指令遵循45%、对话90%。主要结果(128M tokens训练,无专家池化,与原始SDAR-30B对比):GSM8K +1.4、MATH-500 −0.8、MBPP +0.8、HumanEval −3.7、GPQA-Diamond −0.5、AIME −1.1、IFEval −1.7,均在噪声范围内,且每32-token块的MoE次数减少1.30–1.41×;使用DES48专家池化时计算加速更大(1.28–1.42×)但GPQA和IFEval下降。注意:该数据集包含GPQA-Diamond的逐题评估记录(引用了GPQA题目),GPQA作者不允许公开传播纯文本题目,请勿将这些文件用于训练。
The dataset is a judgment corpus for the SDAR-30B-A3B model (phase 1 of the 1B tokens plan), containing the models own validation answers, drafts, training samples, training logs, and evaluation records. The data comes from 2.24M prompts (covering math, code, science, instruction following, and conversation), with answers generated by a 30B model, block drafts generated by a 1.7B draft model, and filtered by a judgment model. The dataset is structured by directories: prompt lists (domain, source, wave, checker key, etc.), eval sets (IFEval-541, FinQA-500, ChartQA-300, chat800), generation logs (containing kept answers and rejection reasons), draft npz files, training set (index + items tar), training logs (containing configuration, probe, replay), evaluation records (each problem record for checkpoint and probe), and analysis files. The corpus totals 134.4M tokens (wave A 74.76M tokens/165,438 items, wave B 59.67M tokens/166,380 items, wave B supplementary code and random 115K conversation subset to be added). Domain keep rates: math 45%, code 73%, science 20%, instruction following 45%, dialogue 90%. Main results (128M tokens training, no expert pooling, compared to original SDAR-30B): GSM8K +1.4, MATH-500 −0.8, MBPP +0.8, HumanEval −3.7, GPQA-Diamond −0.5, AIME −1.1, IFEval −1.7, all within noise range, with MoE calls per 32-token block reduced by 1.30–1.41×; with DES48 expert pooling computation speedup is larger (1.28–1.42×) but GPQA and IFEval degrade. Note: this dataset contains per-problem evaluation records for GPQA-Diamond (citing GPQA problems). The GPQA authors do not allow public dissemination of plain-text problems; do not use these files for training.
数据集概述
基本信息
- 数据集名称:Phase 1 judge corpus for SDAR-30B-A3B (1B-token plan) — corpus, logs and evals
- 许可证:other
- 标签:block-diffusion, speculative-decoding, moe, sdar
- 相关资源:
- 代码:GitHub
phase1-datacorpus - 权重:Arushhh/c1b-judge-lora-sdar30b-b32
- 代码:GitHub
数据内容
包含 30B 模型对 224 万条提示(数学、代码、科学、指令跟随、聊天)的自身校验答案、1.7B drafter 的 block drafts、由它们构建的训练条目、所有训练日志与探针,以及所有评估记录。
一次性获取全部内容(代码 + 本数据集 + 权重,布局与训练机器一致):从 GitHub 仓库执行 bash code/corpus1b/ops/retrieve_all.sh(参见其中的 RETRIEVE.md)。
目录布局(路径镜像仓库根目录)
| 路径 | 内容 |
|---|---|
data/c1b/prompt_lists/<domain>.jsonl |
224 万条提示(pid、domain、source、wave A/B、checker key、meta);postdecontam_*.json 为后期去污染 |
data/c1b/eval/ |
评估集(IFEval-541、FinQA-500、ChartQA-300、chat800) |
logs/c1b/gen/wave{A,B}/gpu<k>/ |
records.*.jsonl.gz(保留答案带 prompt_ids + 32-token blocks;被拒答案保留原因)、done.txt、stats.jsonl |
logs/c1b/draft/wave{A,B}/gpu<k>/ |
drafter block drafts(drafts.*.npz) |
logs/c1b/trainset/wave{A,B}/ |
index.jsonl + items_tar/<h2>.tar(→ items/<h2>/*.npz);index_128m.jsonl(合并,使用 28.5M→128M)、holdout_pids_waveA.txt(固定探针集) |
logs/c1b/train/<run>/ |
main(0→28.5M tokens)、main_128m(28.5M→128M):train.rank*.jsonl、probe.jsonl、config.json、已见数据回放/报告 |
logs/c1b/eval/checkpoint*/、probe128M/、aime4k/ |
每个评估检查点与设置的逐题记录 + summary.md/json |
logs/c1b/analysis/ |
GPQA teacher-forced probe(28.5M vs 128M) |
logs/c1b/dl/、logs/c1b/*.log |
精确的运维脚本与运行日志 |
语料规模(语料 tokens = prompt + 保留答案)
- Wave A:74.76M(165,438 items)
- Wave B(科学 + IF 完成,数学/聊天部分完成):59.67M(166,380 items)
- 合计:134.4M
- 正在添加 wave-B 代码 + 随机 115K 聊天子集(2026-09-30/10-01)
- 保留率:数学 45%、代码 73%、科学 20%、IF 45%、聊天 90%
- 已针对 GSM8K、MATH、MATH-500、AIME、GPQA、HumanEval、MBPP、IFEval 去污染(独立审计未发现重叠)
主要结果(judge 在 128M tokens,无 expert pooling,与 stock SDAR-30B 配对比较)
- GSM8K 91.6 (+1.4)
- MATH-500 71.6 (−0.8)
- MBPP 66.1 (+0.8)
- HumanEval 74.4 (−3.7)
- GPQA-Diamond 36.9 (−0.5)
- AIME 5.6 (−1.1)
- IFEval 51.0 (−1.7)
均在 stock 的噪声范围内,每 32-token block 的 MoE passes 减少 1.30–1.41×。使用 DES48 expert pooling 时计算加速更大(1.28–1.42×),但 GPQA(−7.1)和 IFEval(−14.6)下降。详情见 GitHub 上的 docs/results/phase1/nopool_vs_des48_128M.md。
注意事项
本仓库包含逐题 GPQA-Diamond 评估记录(模型答案引用了 GPQA 问题),应所有者要求发布。GPQA 作者要求其示例不要以纯文本形式转发;请勿在这些文件上训练。





