遇见数据集

densemixer-ab-qwen3-30b-a3b-thinking-opencode-serveparity-idEval

收藏
Hugging Face2026-07-20 更新2026-07-21 收录
官方服务:

资源简介:

该数据集名为 DenseMixer A/B serve-parity ID-eval (Qwen3-30B-A3B-Thinking, opencode dev_set_v2),是一个用于对比实验的评估轨迹和权重/路由分析数据集。其背景与目的是通过受控配对初始化A/B消融测试,评估 DenseMixer 训练方法(密集前向传播 + STE 反事实路由器梯度)对混合专家模型(MoE)在指令微调(SFT)中质量的影响,以实证回答相关研究问题。数据内容主要包括:1) A/B 两组实验的完整评估轨迹,其中 A 组为 DenseMixer 开启的密集模式,B 组为 DenseMixer 关闭的稀疏控制模式,每组包含 100 个任务 × 3 次重复的评估结果,文件包括每项任务的结果、配置、代理轨迹和验证数据;2) 权重空间和路由分析数据,涵盖路由决策重叠度、输出分布差异(如 JS 散度)、专家复活统计和模块级权重变化等;3) 实验结果汇总,如有效均值、完成率、解决任务数等指标。数据规模涉及 300 次评估试验(每组约 264/263 次有效试验),基于特定模型(Qwen3-30B-A3B-Thinking)和数据源(opencode 轨迹)生成。该数据集适用于文本生成任务的研究,特别是用于分析 MoE 模型中稀疏与密集训练方法的性能差异、路由行为变化以及权重更新效果,为模型优化和评估提供实证支持。

The dataset is named DenseMixer A/B serve-parity ID-eval (Qwen3-30B-A3B-Thinking, opencode dev_set_v2) and is an evaluation trajectory and weight/routing analysis dataset for comparative experiments. Its background and purpose are to evaluate the impact of the DenseMixer training method (dense forward propagation + STE counterfactual router gradients) on the quality of Mixture of Experts (MoE) models in instruction fine-tuning (SFT) through controlled paired initialization A/B ablation testing, empirically addressing related research questions. The data content primarily includes: 1) Complete evaluation trajectories for A/B group experiments, where Group A is the dense mode with DenseMixer enabled, and Group B is the sparse control mode with DenseMixer disabled. Each group contains evaluation results for 100 tasks × 3 repetitions, with files including results, configurations, agent trajectories, and validation data for each task; 2) Weight space and routing analysis data, covering routing decision overlap, output distribution differences (e.g., JS divergence), expert revival statistics, and module-level weight changes; 3) Summary of experimental results, such as effective means, completion rates, and number of solved tasks. The data scale involves 300 evaluation trials (approximately 264/263 valid trials per group), generated based on a specific model (Qwen3-30B-A3B-Thinking) and data source (opencode trajectories). This dataset is suitable for research on text generation tasks, particularly for analyzing performance differences between sparse and dense training methods in MoE models, routing behavior changes, and weight update effects, providing empirical support for model optimization and evaluation.

提供机构:
LAION eV
创建时间:
2026-07-20
原始信息汇总

数据集概述

数据集内容

该数据集包含用于 DenseMixer 方法的控制配对初始化 A/B 消融实验的完整工件,旨在测试 DenseMixer(训练时稠密前向 + STE 反事实路由器梯度)是否能提升 MoE SFT 质量。

实验设置

  • 基础模型: Qwen3-30B-A3B-Thinking-2507(共享初始化)
  • 训练数据: penfever/nemotron-code-oracle-filtered-qwen3.5-122b-131k-opencode-traces(服务奇偶性重建,包含 <tools> 系统块、结构化 tool_callsrole:tool
  • A 组(稠密,DenseMixer 开启): dense_mixer: true,模型 laion/qwen3-30b-a3b-thinking-opencode-sft-densemixer-serveparity
  • B 组(稀疏,DenseMixer 关闭): dense_mixer: false,模型 laion/qwen3-30b-a3b-thinking-opencode-sft-sparse-serveparity
  • 训练参数: 366 步,种子 42,相同数据与顺序,相同学习率调度,ZeRO-3,序列长度 16384,聊天模板 tokenizer_default
  • 评估: 智能体 opencode 在 DCAgent/dev_set_v2 上(100 个任务 × 3 次重复),最大输入 65536,最大输出 16384

主要结果

  • A 组(稠密): 有效验证均值 0.0589(标准误 0.0139),有效试验 264/300(88.0%),解决 19 个任务
  • B 组(稀疏): 有效验证均值 0.0959(标准误 0.0175),有效试验 263/300(87.7%),解决 30 个任务
  • 结论: 稀疏组略优于稠密组(有效差异约 3.7 个百分点),但差异不显著(z ≈ 1.66,p ≈ 0.10)。DenseMixer 未带来可测量的 ID-eval 改进,且名义上略差。B 组因故障中途停止,但有效试验次数接近。

权重空间与路由分析

  • 路由决策未变: 稠密组与稀疏组相对基础模型的 top-8 重叠度相似(0.859 vs 0.860,差异 < 0.001),DenseMixer 的“正确路由器梯度”未改变专家选择
  • 输出几乎一致: 稠密组与稀疏组在 49k 词元探针上的输出分布平均 JS 散度为 0.0035
  • 无死专家复活: 稀疏组中 178 个接近冻结的专家,DenseMixer 复活了 0 个
  • 路由器差异: 路由器 Δθ 方向不同(跨运行余弦 0.435 vs 其他 0.60–0.74),且处于更低秩集合中(稠密稳定秩 13.3 vs 稀疏 22.2),但未导致路由或输出变化

数据集文件结构

  • densemixer_ab_A_dense_traces.tgz: A 组(稠密)完整每试验评估轨迹,包含 result.jsonconfig.jsonagent/trajectory.jsonverifier/manifest.json
  • densemixer_ab_B_sparse_traces.tgz: B 组(稀疏)相同格式轨迹
  • analysis/: 包含 routing_3A.json(每层 top-k 重叠/熵)、kl_2D.json(JS/KL 散度)、svd_summary.jsonexpert_revival.jsonper_bucket_summary.csv(每模块 Δθ 幅度/余弦)
  • results/: 包含两个聚合 result.json(A 组含 result_with_std_error.json)、评估 config.jsonper_task_summary.csv(88 个任务的稠密 vs 稀疏每任务均值)
搜集汇总
数据集介绍
densemixer-ab-qwen3-30b-a3b-thinking-opencode-serveparity-idEval 数据集图片
构建方式
该数据集源于一项针对DenseMixer方法的受控配对初始化A/B消融实验,旨在验证DenseMixer是否能够提升MoE模型的监督微调质量。实验以Qwen/Qwen3-30B-A3B-Thinking-2507为统一初始参数,采用相同的训练数据、学习率调度与ZeRO-3优化策略,仅通过切换`dense_mixer`标志位区分两组实验:A组开启DenseMixer,B组为稀疏对照组。两组均以固定种子42训练366步,序列长度16384,并在DCAgent/dev_set_v2上进行智能体式opencode评估。最终将完整评估轨迹、路由分析及权重差异等产物整理为该数据集。
特点
该数据集的核心特点是记录了DenseMixer在MoE模型监督微调中功能惰性的实证证据。评估结果显示,稀疏对照组在valid-only平均得分(0.0959)上优于DenseMixer组(0.0589),但差异未达统计显著性(p≈0.10)。路由分析表明,两组在专家选择上几乎无差异(top-8重叠约0.86),输出分布平均JS散度仅为0.0035,且DenseMixer未能复活任何濒死专家。唯一可观测的差异在于路由器权重更新的方向与低秩结构,但未对路由决策或输出产生实质性影响。
使用方法
该数据集适用于研究MoE模型微调中路由器梯度行为及其对模型性能的影响。使用者可通过`densemixer_ab_A_dense_traces.tgz`和`densemixer_ab_B_sparse_traces.tgz`获取两组实验的逐任务评估轨迹,包括结果文件、配置及智能体轨迹。`analysis`目录提供了路由重叠、KL散度、奇异值分解和专家复活等分析结果。`results`目录包含聚合评估结果及分任务摘要。这些资源可复现实验结论,或作为对比基线支持进一步的路由器梯度研究。
背景与挑战
背景概述
DenseMixer A/B Serve-Parity ID-Eval数据集由LAION机构的研究团队于近期创建,旨在系统评估DenseMixer训练策略——即在前向传播中引入稠密计算并结合STE反事实路由器梯度——对混合专家模型(MoE)监督微调(SFT)质量的实际影响。该研究基于Qwen3-30B-A3B-Thinking模型,通过严格的配对初始化A/B实验设计,分别训练稠密(DenseMixer启用)与稀疏(DenseMixer禁用)两支模型,并在同等条件下进行agentic code评测。其核心研究问题在于验证DenseMixer是否能够通过纠正路由器梯度来提升MoE模型的微调表现。这一工作为MoE领域的训练策略优化提供了关键实验证据,并引发了对现有梯度纠正方法有效性的深入思考。
当前挑战
该数据集所应对的领域挑战在于,混合专家模型在监督微调过程中,稀疏路由机制可能导致梯度估计偏差及专家利用率不均,进而制约模型性能的进一步提升。而构建过程本身则面临实验设计的严谨性挑战:如何实现配对初始化解耦DenseMixer的真实效果与随机噪声?如何确保评估任务数量充足(100个任务×3次重复)以获取统计显著性?实验过程中还需应对基础设施故障(如Daytona快照停滞、Sandbox构建失败),导致B组实验被迫中止,虽通过堆叠时间保证了与A组相当的有效试验次数,但部分完备性仍存疑。此外,还需通过多维分析(路由重叠、输出分布散度、权重变化奇异值等)排除假阳性结论,这要求高度精细的数据处理与模式识别能力。
常用场景
经典使用场景
DenseMixer A/B serve-parity ID-eval数据集的核心应用场景在于对混合专家模型(MoE)中新型训练技术的对比验证。研究者可通过该数据集精确复现对照实验,即控制除DenseMixer开关外的全部训练参数(包括基础模型、训练数据、学习率策略、随机种子等),系统评估DenseMixer技术对MoE模型在指令微调阶段性能的因果影响。该数据集提供了两套完整且对齐的评估轨迹(traces),使学术界能够严格检验将密集前向传播与直通估计器(STE)反事实路由器梯度相结合的方法是否能实质性提升MoE模型质量。
衍生相关工作
该数据集催生了数项富有价值的延伸研究。其完整的18,867个张量与6,144个专家的权重空间分析促进了针对路由器梯度动力学的新探索,特别是关于低秩重定向为何不影响路由决策的理论解释。数据集详尽记录了每项任务(88个子任务)的密集与稀疏变体的逐次评估分数,为开发细粒度的专家利用率分析工具提供验证基础。此外,濒死专家复苏的零效果证据启发了后续对专家退化机制及其恢复策略的重新审视,推动了在MoE训练中探索更根本的路由正则化方法的研究方向(如marin社区中的相关讨论)。
数据集最近研究
最新研究方向
基于DenseMixer机制的开源代码生成SFT对比实验,揭示了在Qwen3-30B-A3B-Thinking模型上,仅通过密向前传播与STE反事实路由梯度的训练策略,在serve-parity评估环境下对MoE微调性能未产生显著影响。实验采用配对初始化的A/B测试,严格控除了DenseMixer标志外的所有变量,结果发现稀疏基线(无DenseMixer)在有效测试均值上略优于密集成(0.0959对0.0589),但统计上无显著差异(z≈1.66,p≈0.10)。进一步权重空间与路由分析表明,DenseMixer仅导致路由器权重的低秩重定向,而未改变实际路由选择(top-8重叠度0.859对0.860),输出分布几乎一致(平均JS散度0.0035),且未能复活任何失活专家。这一结论为当前MoE模型在固定数据与训练范式下,DenseMixer的功能性无效提供了实证证据,促使研究者重新审视路由梯度修正机制在微调阶段的必要性,并推动对更高效专家激活策略的探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务