MoE 架构演进:从 Switch Transformer 到 LatentMoE

2026-06-28 · 博客首页

"总参数几百 B、激活参数几十 B"——MoE(Mixture of Experts,混合专家)是当前超大模型的主流配方。理清它的演进线,既懂架构又攒了面试谈资。

MoE 的基本盘

把 FFN 层换成一组"专家"网络 + 一个路由器(router):每个 token 只被路由到 Top-K 个专家(通常 K=1~2),其余专家不激活。

  • 好处:总容量大(知识多),单 token 计算量小(推理便宜);
  • 难点:负载不均(专家忙闲不均)、路由不稳定、通信开销(专家分布式部署时)。

演进四站

1. Switch Transformer(2021)
把 Top-K 简化成 Top-1,加辅助负载均衡 loss。证明"稀疏激活"可以 scale 到万亿参数。

2. GShard / GLaM
解决专家跨设备分片的通信问题,确立 MoE 的工程范式。

3. DeepSeekMoE / DeepSeek-V2/V3
两招出圈:细粒度专家(把专家切小、组合更灵活)+ 共享专家(通用知识走共享通道,路由只分配专业知识)。后续 MLA、Multi-token Prediction 一并把推理效率卷到极致。

4. LatentMoE(2025-2026 新方向)
MoE 研究的新焦点转向"每个 FLOP、每个参数换来的准确率最优":把专家机制放进压缩的隐空间(latent space)运作,降低路由和专家计算的开销——Kimi 新一代模型的架构讨论中它是核心角色。方向本质:MoE 的红利从"简单堆专家"进入"更聪明地分配计算"阶段。

面试考点清单

  • 路由怎么做(Top-K、noisy top-k、auxiliary loss 防塌缩);
  • 专家负载均衡怎么实现、失衡了会怎样;
  • MoE 与 dense 模型同参数量下为何训练更划算、推理显存为何反而更大(总参数都要驻留);
  • DeepSeek 的细粒度 + 共享专家设计动机。

前沿架构怎么读得快:论文截图按 Alt+Q 让 AI 逐段拆(工具免费 3 次)。更多架构考点看大模型面试图谱。

看完想试试?按 Alt+Q 截屏,AI 秒答,答案直达微信。
免费下载 购买次数