Muon 优化器原理详解: momentum + 正交化,凭什么火遍开源社区

2026-06-30 · 博客首页

Adam 统治十余年后,优化器领域久违地出了个新明星:Muon(MomentUm Orthogonalized)。它从开源社区的 nanoGPT 加速实验里走红,如今不少新一代模型的训练配方里都有它。

核心思想一句话

先用 momentum 累积更新方向,再把这个方向矩阵正交化,最后按固定步长更新。

三步拆开看:

  1. Momentum:和经典动量一样,对梯度做指数滑动平均,得到平滑的更新矩阵 M;
  2. 正交化:对 M 做近似极分解(polar decomposition)——直觉上就是"保留方向、抹掉各个方向上的长度差异",让所有奇异值变成 1;
  3. 更新:用正交化后的矩阵乘学习率去更新参数。

实现上,正交化用 Newton-Schulz 迭代近似完成——只需要几次矩阵乘,GPU 上极其高效,这是它能实用的关键。

为什么有效

Adam 类方法对每个参数单独自适应调步长,信息其实丢了不少。正交化更新相当于对整个矩阵谱做归一化:防止某些方向(大奇异值方向)步子过大、某些方向走得太慢。在小规模 Transformer 训练上,Muon 常以更少的步数达到同等 loss。

适用边界(面试常追问)

  • 主要适用于二维权重矩阵(如 Transformer 的线性层);embedding、LayerNorm 这类参数通常仍交给 AdamW;
  • 大 batch、超大模型上的表现仍在验证中,工业界多是"Muon + AdamW 混用"的配方;
  • 学习率语义与 Adam 不同,迁移配方时要重调。

学习建议

读两样东西就够入门:Muon 的原始实现(几十行代码,值得手推一遍)+ Adam 与 SGD 的对比基础。面试被问"你了解哪些新优化器",能讲清 Muon 的正交化直觉就赢过 90% 的竞争者。优化器基础考点复习看深度学习面试。

看完想试试?按 Alt+Q 截屏,AI 秒答,答案直达微信。
免费下载 购买次数