densemixer-ab-qwen3-30b-a3b-thinking-opencode-serveparity-idEval
收藏资源简介:
该数据集名为 DenseMixer A/B serve-parity ID-eval (Qwen3-30B-A3B-Thinking, opencode dev_set_v2),是一个用于对比实验的评估轨迹和权重/路由分析数据集。其背景与目的是通过受控配对初始化A/B消融测试,评估 DenseMixer 训练方法(密集前向传播 + STE 反事实路由器梯度)对混合专家模型(MoE)在指令微调(SFT)中质量的影响,以实证回答相关研究问题。数据内容主要包括:1) A/B 两组实验的完整评估轨迹,其中 A 组为 DenseMixer 开启的密集模式,B 组为 DenseMixer 关闭的稀疏控制模式,每组包含 100 个任务 × 3 次重复的评估结果,文件包括每项任务的结果、配置、代理轨迹和验证数据;2) 权重空间和路由分析数据,涵盖路由决策重叠度、输出分布差异(如 JS 散度)、专家复活统计和模块级权重变化等;3) 实验结果汇总,如有效均值、完成率、解决任务数等指标。数据规模涉及 300 次评估试验(每组约 264/263 次有效试验),基于特定模型(Qwen3-30B-A3B-Thinking)和数据源(opencode 轨迹)生成。该数据集适用于文本生成任务的研究,特别是用于分析 MoE 模型中稀疏与密集训练方法的性能差异、路由行为变化以及权重更新效果,为模型优化和评估提供实证支持。
The dataset is named DenseMixer A/B serve-parity ID-eval (Qwen3-30B-A3B-Thinking, opencode dev_set_v2) and is an evaluation trajectory and weight/routing analysis dataset for comparative experiments. Its background and purpose are to evaluate the impact of the DenseMixer training method (dense forward propagation + STE counterfactual router gradients) on the quality of Mixture of Experts (MoE) models in instruction fine-tuning (SFT) through controlled paired initialization A/B ablation testing, empirically addressing related research questions. The data content primarily includes: 1) Complete evaluation trajectories for A/B group experiments, where Group A is the dense mode with DenseMixer enabled, and Group B is the sparse control mode with DenseMixer disabled. Each group contains evaluation results for 100 tasks × 3 repetitions, with files including results, configurations, agent trajectories, and validation data for each task; 2) Weight space and routing analysis data, covering routing decision overlap, output distribution differences (e.g., JS divergence), expert revival statistics, and module-level weight changes; 3) Summary of experimental results, such as effective means, completion rates, and number of solved tasks. The data scale involves 300 evaluation trials (approximately 264/263 valid trials per group), generated based on a specific model (Qwen3-30B-A3B-Thinking) and data source (opencode trajectories). This dataset is suitable for research on text generation tasks, particularly for analyzing performance differences between sparse and dense training methods in MoE models, routing behavior changes, and weight update effects, providing empirical support for model optimization and evaluation.
数据集概述
- 数据集名称: DenseMixer A/B — serve-parity ID-eval traces + weight-delta/routing analysis
- 数据集地址: https://huggingface.co/datasets/laion/densemixer-ab-qwen3-30b-a3b-thinking-opencode-serveparity-idEval
- 许可证: Apache-2.0
- 任务类别: 文本生成
- 标签: moe, densemixer, sft, router-gradient, eval-traces, qwen3-moe
数据集内容
该数据集包含用于 DenseMixer 方法的控制配对初始化 A/B 消融实验的完整工件,旨在测试 DenseMixer(训练时稠密前向 + STE 反事实路由器梯度)是否能提升 MoE SFT 质量。
实验设置
- 基础模型: Qwen3-30B-A3B-Thinking-2507(共享初始化)
- 训练数据: penfever/nemotron-code-oracle-filtered-qwen3.5-122b-131k-opencode-traces(服务奇偶性重建,包含
<tools>系统块、结构化tool_calls和role:tool) - A 组(稠密,DenseMixer 开启):
dense_mixer: true,模型laion/qwen3-30b-a3b-thinking-opencode-sft-densemixer-serveparity - B 组(稀疏,DenseMixer 关闭):
dense_mixer: false,模型laion/qwen3-30b-a3b-thinking-opencode-sft-sparse-serveparity - 训练参数: 366 步,种子 42,相同数据与顺序,相同学习率调度,ZeRO-3,序列长度 16384,聊天模板
tokenizer_default - 评估: 智能体 opencode 在 DCAgent/dev_set_v2 上(100 个任务 × 3 次重复),最大输入 65536,最大输出 16384
主要结果
- A 组(稠密): 有效验证均值 0.0589(标准误 0.0139),有效试验 264/300(88.0%),解决 19 个任务
- B 组(稀疏): 有效验证均值 0.0959(标准误 0.0175),有效试验 263/300(87.7%),解决 30 个任务
- 结论: 稀疏组略优于稠密组(有效差异约 3.7 个百分点),但差异不显著(z ≈ 1.66,p ≈ 0.10)。DenseMixer 未带来可测量的 ID-eval 改进,且名义上略差。B 组因故障中途停止,但有效试验次数接近。
权重空间与路由分析
- 路由决策未变: 稠密组与稀疏组相对基础模型的 top-8 重叠度相似(0.859 vs 0.860,差异 < 0.001),DenseMixer 的“正确路由器梯度”未改变专家选择
- 输出几乎一致: 稠密组与稀疏组在 49k 词元探针上的输出分布平均 JS 散度为 0.0035
- 无死专家复活: 稀疏组中 178 个接近冻结的专家,DenseMixer 复活了 0 个
- 路由器差异: 路由器 Δθ 方向不同(跨运行余弦 0.435 vs 其他 0.60–0.74),且处于更低秩集合中(稠密稳定秩 13.3 vs 稀疏 22.2),但未导致路由或输出变化
数据集文件结构
densemixer_ab_A_dense_traces.tgz: A 组(稠密)完整每试验评估轨迹,包含result.json、config.json、agent/trajectory.json、verifier/、manifest.jsondensemixer_ab_B_sparse_traces.tgz: B 组(稀疏)相同格式轨迹analysis/: 包含routing_3A.json(每层 top-k 重叠/熵)、kl_2D.json(JS/KL 散度)、svd_summary.json、expert_revival.json、per_bucket_summary.csv(每模块 Δθ 幅度/余弦)results/: 包含两个聚合result.json(A 组含result_with_std_error.json)、评估config.json、per_task_summary.csv(88 个任务的稠密 vs 稀疏每任务均值)




