遇见数据集

comoe-artifacts

收藏
Hugging Face2026-07-28 更新2026-07-29 收录
官方服务:

资源简介:

本仓库包含一个用于通信高效混合专家系统的构件集合,包括经过监督微调的冻结基础模型(作为训练和评估骨干)、多种离线编解码器(如基于闭式解的iso2x初始化和基于重构损失的初始化)、名为dolci-no-tools的原始及分词后的训练数据、用于构建编解码器的模型激活缓存,以及详细的评估结果。这些资源专门用于支持压缩编解码器在混合专家模型中的研究、训练与性能评估。

This repository contains a collection of components for communication-efficient Mixture-of-Experts (MoE) systems, including a supervised fine-tuned frozen base model used as the backbone for training and evaluation, multiple offline codecs (e.g., iso2x initialization based on closed-form solution and initialization based on reconstruction loss), raw and tokenized training data named dolci-no-tools, model activation caches for codec construction, and detailed evaluation results. These resources are specifically designed to support research, training, and performance evaluation of compressed codecs in Mixture-of-Experts models.

创建时间:
2026-07-28
原始信息汇总

数据集:comoe-artifacts

概述

该数据集包含与“通信高效混合专家模型(communication-efficient-moe)”相关的构件,用于通过学习的线性编解码器在冻结的Qwen3-30B-A3B模型上实现2倍速率的全对全压缩。

关键说明

  • 基础模型:所有构件均与经过SFT微调的基础模型(models/sft-base-qwen3-30b-a3b/,无编解码器时5任务平均得分81.7)配对使用。
  • 版本提醒:此前为Qwen/Qwen3-30B-A3B-Instruct-2507(一个不同的模型)上传的exp6-iso206x编解码器已被移除,以避免不匹配。

数据集结构

路径 内容说明
models/sft-base-qwen3-30b-a3b/ 冻结的SFT基础模型(fullft dolci),用于训练/评估的主干网络
offline-codecs/dispatch-2x-iso-init/ iso2x闭式热启动初始化
offline-codecs/dispatch-2x-recon010-init/ iso-recon@0.10热启动初始化(用于会话配置)
offline-codecs/dispatch-2x-func-realloc-init/ 阶段B功能重新分配热启动初始化
data/raw/, data/tokenized/ dolci-no-tools数据(原始arrow格式+分词后的qwen3-2048格式)
activation_cache/dolci-500k-s1234-step4000/ 分发激活缓存(用于构建编解码器)
evals/ 每个运行的lm-eval JSON结果

编解码器格式

编解码器采用{compression.pt, meta.json}格式,这是训练/评估脚本所需的格式。

搜集汇总
数据集介绍
comoe-artifacts 数据集图片
构建方式
comoe-artifacts数据集围绕通信高效的混合专家模型(MoE)构建,旨在通过学习的线性编解码器实现全对全分发压缩,压缩倍率为2倍。数据集以冻结的Qwen3-30B-A3B模型为基础,包含经全参数微调(SFT)的基座模型、多种离线编解码器(如iso2x闭式初始化、iso-recon@0.10初始化及功能重分配初始化),以及原始与tokenized格式的训练数据。此外,还提供了用于构建编解码器的分发激活缓存和评测结果。编解码器以compression.pt和meta.json格式存储,兼容训练与评估脚本。
特点
该数据集的核心特点在于其面向特定模型与通信压缩场景的专精性,所有组件均与经过SFT的Qwen3-30B-A3B基座模型严格配对,确保一致性与可复现性。数据集不仅包含了完整的训练数据与预处理后的token序列,还提供了多种离线编解码器初始化方案,便于研究者探索不同压缩策略的效果。此外,标准化编解码器格式与结构化的目录划分,显著降低了模型部署与评测的门槛。
使用方法
使用comoe-artifacts数据集时,研究者可直接加载sft-base-qwen3-30b-a3b目录下的基座模型,并结合offline-codecs中各初始化方案对应的编解码器进行压缩实验。训练与评估脚本会自动识别compression.pt与meta.json文件。数据集中的原始Arrow数据与tokenized数据(基于Qwen3的2048长度token化)可直接用于模型训练,而activation_cache则可用于自定义编解码器的构建与比较。所有评测结果均以JSON格式存放于evals目录下,便于横向对比分析。
背景与挑战
背景概述
随着大规模语言模型(LLM)规模的不断扩张,分布式训练中的通信开销已成为制约训练效率的关键瓶颈。在此背景下,2025年由相关研究团队针对Qwen3-30B-A3B模型提出的通信高效混合专家(communication-efficient-moe)方法,旨在通过引入可学习的线性编解码器,对分布式训练中的全到全(all-to-all)通信进行压缩,实现2倍加速。该数据集(comoe-artifacts)作为配套资源,包含了经过微调的基座模型、多种离线编解码器预初始化权重、原始及分词后的训练数据、激活值缓存以及评测结果,为验证通信压缩策略在冻结模型上的有效性提供了完整的研究支撑,对推动高效分布式LLM训练技术发展具有重要参考价值。
当前挑战
该数据集所解决的领域核心挑战在于:在混合专家(MoE)模型分布式训练中,全到全通信的带宽占用过高,严重限制了训练吞吐量,尤其当模型如Qwen3-30B-A3B达到数百亿参数规模时,通信开销可能占总训练时间的可观比例。具体而言,传统压缩方法往往难以在保持模型任务性能(如5任务平均81.7%的准确率)的同时实现显著的传输降量。此外,数据集的构建过程亦面临挑战:编解码器的设计需要针对特定基座模型(而非通用指令模型)进行精确适配,且多阶段初始化策略(如几何重构、功能重分配等)需通过大量激活缓存与消融实验来筛选最优组合,确保压缩后的模型在冻结状态下不出现性能衰退。
常用场景
经典使用场景
在大型语言模型的分布式训练与推理中,通信效率是制约模型规模扩展的关键瓶颈。comoe-artifacts数据集专为探索通信高效的专家混合(MoE)架构而设计,其经典使用场景聚焦于通过学习型线性编解码器对MoE路由过程中的全对全通信进行压缩。具体而言,研究者借助该数据集内含的冻结SFT基座模型、离线编解码器权值以及激活缓存,可在2倍压缩率下验证调度分发的压缩效果,从而在保持模型性能的同时显著降低跨设备通信开销。
解决学术问题
该数据集解决了MoE模型在分布式训练中因专家分派导致的通信瓶颈这一核心学术问题。传统MoE架构中,全对全通信的带宽需求随专家数量线性增长,严重限制了模型扩展效率。comoe-artifacts通过提供完整的编解码器初始化方案(包括闭合形式与功能重分配初始化)以及配套的训练/评估脚本,使研究者能够系统性地研究线性压缩对模型路由精度与下游任务性能的影响。其意义在于奠定了基于学习型压缩提升MoE通信效率的实证基础,推动了大模型高效分布式训练的范式演进。
衍生相关工作
该数据集衍生了若干推动通信压缩领域发展的经典工作。例如,基于其提供的iso2x闭合形式初始化解码器,研究者进一步提出了阶段式功能重分配(Functional Reallocation)算法,将压缩编解码器的收敛效率提升了显著幅度。此外,数据集内Dolci训练管线所对应的激活缓存,催生了面向MoE模型的分层压缩策略研究——即针对不同路由频率的专家采用差异化压缩率,相关工作已被后续用于探索更大规模(如100B参数级别)MoE模型的分布式部署方案。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务