MoE 架构演进:从 Switch Transformer 到 LatentMoE
2026-06-28 · 博客首页
"总参数几百 B、激活参数几十 B"——MoE(Mixture of Experts,混合专家)是当前超大模型的主流配方。理清它的演进线,既懂架构又攒了面试谈资。
MoE 的基本盘
把 FFN 层换成一组"专家"网络 + 一个路由器(router):每个 token 只被路由到 Top-K 个专家(通常 K=1~2),其余专家不激活。
- 好处:总容量大(知识多),单 token 计算量小(推理便宜);
- 难点:负载不均(专家忙闲不均)、路由不稳定、通信开销(专家分布式部署时)。
演进四站
1. Switch Transformer(2021)
把 Top-K 简化成 Top-1,加辅助负载均衡 loss。证明"稀疏激活"可以 scale 到万亿参数。
2. GShard / GLaM
解决专家跨设备分片的通信问题,确立 MoE 的工程范式。
3. DeepSeekMoE / DeepSeek-V2/V3
两招出圈:细粒度专家(把专家切小、组合更灵活)+ 共享专家(通用知识走共享通道,路由只分配专业知识)。后续 MLA、Multi-token Prediction 一并把推理效率卷到极致。
4. LatentMoE(2025-2026 新方向)
MoE 研究的新焦点转向"每个 FLOP、每个参数换来的准确率最优":把专家机制放进压缩的隐空间(latent space)运作,降低路由和专家计算的开销——Kimi 新一代模型的架构讨论中它是核心角色。方向本质:MoE 的红利从"简单堆专家"进入"更聪明地分配计算"阶段。
面试考点清单
- 路由怎么做(Top-K、noisy top-k、auxiliary loss 防塌缩);
- 专家负载均衡怎么实现、失衡了会怎样;
- MoE 与 dense 模型同参数量下为何训练更划算、推理显存为何反而更大(总参数都要驻留);
- DeepSeek 的细粒度 + 共享专家设计动机。