遇见数据集

moe-routing-drift-results

收藏
Hugging Face2026-08-31 更新2026-09-01 收录
官方服务:

资源简介:

该数据集记录了MoE(混合专家)路由漂移实验的测量结果,旨在评估适配方法(无、GEPA、prompt-tuning、prefix-tuning)与路由器重训练(冻结门控、重训练门控)之间的交互效应。实验基于两个模型:inclusionAI/Ling-mini-2.0和Qwen/Qwen3-30B-A3B-Instruct-2507。数据内容涵盖多个方面:cells.jsonl包含汇总表格,每行对应一个实验单元(模型、任务、适配方法、路由器状态、数据分割、F1分数、精确匹配、配对t检验);quality/文件夹存储原始测量JSON(含逐样本分数和生成结果);routing/文件夹提供路由漂移和专家负载指标(基尼系数、有效专家数、死亡专家比例);gepa/文件夹包含GEPA优化提示、种子、候选分数和预算;reports/包含实验报告和图表;analysis/包含派生分析(软提示几何、偏移向量)。数据集基于google/civil_comments的毒性标注任务,因此文本包含侮辱、身份攻击和淫秽内容。适用场景:评估MoE路由漂移中适配与路由器重训练的互补性,分析专家负载平衡变化,以及复现相关实验。

This dataset records the measurement results of MoE (Mixture of Experts) routing drift experiments, aiming to evaluate the interaction effects between adaptation methods (none, GEPA, prompt-tuning, prefix-tuning) and router retraining (frozen gating, retrained gating). The experiments are based on two models: inclusionAI/Ling-mini-2.0 and Qwen/Qwen3-30B-A3B-Instruct-2507. The data content covers multiple aspects: cells.jsonl contains a summary table, each row corresponding to an experimental unit (model, task, adaptation method, router state, data split, F1 score, exact match, paired t-test); the quality/ folder stores raw measurement JSONs (including per-sample scores and generation results); the routing/ folder provides routing drift and expert load metrics (Gini coefficient, effective number of experts, dead expert ratio); the gepa/ folder contains GEPA optimization prompts, seeds, candidate scores, and budget; the reports/ folder contains experiment reports and charts; the analysis/ folder contains derived analyses (soft prompt geometry, offset vectors). The dataset is based on the toxicity annotation task of google/civil_comments, so the text contains insults, identity attacks, and obscene content. Applicable scenarios: evaluating the complementarity of adaptation and router retraining in MoE routing drift, analyzing changes in expert load balance, and reproducing related experiments.

创建时间:
2026-08-28
原始信息汇总

数据集概述

该数据集为“MoE routing drift — results”,记录了关于混合专家模型(MoE)路由偏移的2x2实验结果,测量了适配方法(无适配/GEPA/提示微调/前缀微调)与路由器重训练(冻结门控/重训练门控)的组合效果,应用于 inclusionAI/Ling-mini-2.0Qwen/Qwen3-30B-A3B-Instruct-2507 两个模型。

核心发现:交互项 Delta_PEFT(衡量适配移动输入后路由器质量恢复程度)在所有实验组中均为负值(Ling模型上为-0.13至-0.15,t值约-13;Qwen上提示微调为-0.20),表明门控重校准与提示适配是替代关系而非互补关系。同时,重训练的路由器并未重新平衡专家负载(Gini系数、有效专家数、死亡专家占比均仅在第四位小数变化)。


数据集内容结构

文件夹 内容
cells.jsonl 核心汇总表:每行对应一个测量单元(模型、任务、实验臂、路由器状态、数据划分、F1值、精确匹配、配对t检验)
quality/{ling,qwen}/ 原始测量JSON(含逐样本得分,可复现配对检验)及逐样本生成结果
routing/{ling,qwen}/ 路由偏移和专家负载测量(Gini系数、有效专家数、死亡专家占比)
gepa/ GEPA优化提示、需超越的种子提示、候选得分、预算
reports/ 实验报告及2x2实验图
analysis/ 衍生分析JSON(软提示几何、偏移向量)

数据划分与配置

  • 包含两个配置:cells(数据文件 cells.jsonl)和 generations(数据文件 quality/*/*.responses.jsonl
  • 注意quality/*/*.responses.jsonl 包含来自 civil_comments 的原始评论和模型输出,任务为毒性标注,因此可能包含侮辱、身份攻击和淫秽内容

实验细节

  • 两GEPA实验臂记录方式不同gepa/qwen_ml-1000/ 包含完整搜索树(候选树HTML、GEPA状态、运行日志、各验证任务的最佳生成输出);gepa/ling_ml-1000/ 仅有 candidates.json(因该次运行采用精简日志记录),但每个候选提示及其得分均保留
  • 评分方法:逐样本F1(基于预测标签集)、整套精确匹配、对四个单元中相同样本的配对t检验;每个实验臂基于自身贪心生成进行评分,不同实验臂的生成从不逐token对齐
  • 数据来源:任务数据源自 google/civil_comments(CC0-1.0协议),但未在此重新分发train/val/test划分(多标签划分来自合作方而非公共数据集),本仓库仅提供测量结果和流程

注意事项(Caveats)

  • 每个PEFT单元仅使用一个随机种子;基础单元和GEPA单元在种子42/43/44上重复
  • 检查点选择基于200个验证样本(标准误约3.5个百分点)的质量,而非损失
  • 部分Ling单元(bias_gamma=1e-4)在修复bfloat16累积问题之前计算,basefix 行是重新运行的结果,应参照该行解读
  • task: civil 行是较早的二元毒性实验层,其余均为 civil_multilabel
搜集汇总
数据集介绍
moe-routing-drift-results 数据集图片
构建方式
本数据集源自一项严谨的2x2实验设计,旨在探究混合专家模型(MoE)中路由漂移现象。实验交叉了两个关键维度:适配策略(包括无适配、GEPA、提示微调与前缀微调)与路由器重训练状态(冻结门控或重训练门控),并分别在`inclusionAI/Ling-mini-2.0`与`Qwen/Qwen3-30B-A3B-Instruct-2507`两款模型上开展。数据构建的核心围绕交互项Δ_PEFT展开,量化了适配移动输入后路由器恢复的质量增益。数据集精心整理了多层面文件,包括核心表格`cells.jsonl`记录每个测量单元的模型、任务、实验臂、路由器状态等指标,以及原始测量JSON、逐示例生成结果、路由漂移与专家负载测量数据,并附有GEPA优化提示的完整日志与派生的分析JSON,确保实验的可复现性与深度剖析。
特点
该数据集的核心特征在于其揭示的颠覆性发现:适配与路由器重训练之间呈现替代而非互补关系,重训练路由器在基础模型上虽获得+0.146的提升,但在各适配臂上增益微乎其微,导致所有PEFT臂的Δ_PEFT均为负值(-0.13至-0.20),提示适配与重训练存在功能重叠。此外,虽然重训练路由器未能在专家负载平衡上产生实质改变,Gini系数、有效专家数等指标仅在第四位小数波动,但这一负面结果本身极具价值。数据集还记录了GEPA优化过程的完整日志差异,并清晰标注了LLM生成内容中的不当语言警告,同时提供了严谨的评分机制——基于逐示例F1分数、精确匹配与配对t检验,且各臂独立解码,确保了统计置信度与可比性。
使用方法
本数据集适用于MoE模型路由机制的研究与验证。使用者可加载`cells.jsonl`作为主分析表,利用`quality/`目录下的原始测量数据复现配对t检验,通过`routing/`目录分析路由漂移与专家负载变化,`gepa/`目录提供了优化提示的候选与评分,便于追溯提示检索过程。对于需要深入探究的场景,`reports/`中的报告与`analysis/`内的派生JSON可辅助理解实验全貌。注意,由于训练/验证/测试划分未公开,使用者需参考文档中的配方进行数据拆分;同时,`task:civil`行保留早期毒性二分类实验以保持连续性,而其他任务均为多标签分类,使用时需明确任务类型。
背景与挑战
背景概述
在混合专家模型(MoE)领域,路由机制的稳定性与适应性是影响模型性能的关键因素。随着模型规模的扩大,专家路由的漂移现象日益显著,如何在不牺牲性能的前提下实现高效的参数微调成为研究热点。该数据集由元启发式爱好者(AverageMetaheuristicsEnjoyer)团队于近期创建,旨在系统评估适配策略(如GEPA、提示微调、前缀微调)与路由重训练之间的交互效应。其核心研究问题在于探究参数高效微调(PEFT)是否能够提升路由对输入分布的适应能力,进而改善模型质量。该数据集基于Ling-mini-2.0和Qwen3-30B-A3B-Instruct-2507两大模型,通过2x2实验设计,揭示了适配与路由重训练之间存在的替代关系,这一发现对优化MoE模型的部署策略具有重要指导意义,推动了该领域对路由动态行为的理解。
当前挑战
该数据集面临的挑战首先体现在所解决的领域问题上:MoE模型在参数高效微调过程中,路由机制可能因输入分布变化而产生漂移,导致专家负载不均、有效专家数下降,进而影响模型整体性能。数据集实验揭示了一个反直觉的现象——适配与路由重训练并非互补而是替代,这挑战了传统认知,增加了优化难度。其次,在构建过程中,研究者需要严格控制实验条件,然而数据集存在诸多局限:每个PEFT单元仅使用单一随机种子,验证集仅含200个样例(标准误差约3.5个百分点),且部分Ling单元因bfloat16累积修正确认前计算出现偏差,需依赖basefix行进行校正。此外,数据中包含了毒性评论的原始内容,涉及冒犯性语言,对数据发布和伦理审查构成挑战。这些因素共同影响了数据集的可靠性和适用范围。
常用场景
经典使用场景
在混合专家模型(MoE)的研究领域,路由机制的性能直接决定了模型稀疏激活的效率与质量。该数据集为探究MoE路由漂移现象提供了系统性的测量基准,其经典使用场景聚焦于评估不同参数高效微调(PEFT)策略(如GEPA、prompt-tuning、prefix-tuning)与路由器重训练之间的交互效应。研究者可据此复现Delta_PEFT交互量计算,分析路由器在输入分布变化后的质量恢复能力,从而深入理解适应性与路由优化的协同机制。
衍生相关工作
该数据集衍生了一系列关键研究脉络。其路由漂移测量方法可扩展到更大规模MoE模型(如Mixtral、DeepSeek-MoE),催生对专家负载均衡的长期追踪研究。Delta_PEFT交互量的理论框架被后续工作用于推导不同适应策略的互补性条件,启发设计新型混合适应算法。同时,GEPA优化日志为元学习提示优化提供了稀缺的基准数据,推动了基于进化算法的提示搜索研究。该数据集作为公开基准,促进了跨机构对MoE稳定微调的对比验证,成为该领域可重复性研究的重要基石。
数据集最近研究
最新研究方向
该数据集聚焦于混合专家模型(MoE)中路由漂移现象的量化研究,通过2x2实验设计(适配方法:无/GEPA/提示调优/前缀调优,与路由重置:冻结门控/重训门控相结合),系统探究参数高效微调(PEFT)与路由重训之间的交互效应。研究发现,门控重校准与提示适配呈现替代而非互补关系,且重训路由器未能有效平衡专家负载,对Gini系数、有效专家数及死专家比例影响甚微。这一成果为MoE模型的动态路由稳定性与高效适配提供了实证依据,对大型语言模型的可扩展部署与持续学习具有重要意义,也为后续研究路由策略与适配机制协同优化指明了方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务