Muon 优化器原理详解: momentum + 正交化,凭什么火遍开源社区
2026-06-30 · 博客首页
Adam 统治十余年后,优化器领域久违地出了个新明星:Muon(MomentUm Orthogonalized)。它从开源社区的 nanoGPT 加速实验里走红,如今不少新一代模型的训练配方里都有它。
核心思想一句话
先用 momentum 累积更新方向,再把这个方向矩阵正交化,最后按固定步长更新。
三步拆开看:
- Momentum:和经典动量一样,对梯度做指数滑动平均,得到平滑的更新矩阵 M;
- 正交化:对 M 做近似极分解(polar decomposition)——直觉上就是"保留方向、抹掉各个方向上的长度差异",让所有奇异值变成 1;
- 更新:用正交化后的矩阵乘学习率去更新参数。
实现上,正交化用 Newton-Schulz 迭代近似完成——只需要几次矩阵乘,GPU 上极其高效,这是它能实用的关键。
为什么有效
Adam 类方法对每个参数单独自适应调步长,信息其实丢了不少。正交化更新相当于对整个矩阵谱做归一化:防止某些方向(大奇异值方向)步子过大、某些方向走得太慢。在小规模 Transformer 训练上,Muon 常以更少的步数达到同等 loss。
适用边界(面试常追问)
- 主要适用于二维权重矩阵(如 Transformer 的线性层);embedding、LayerNorm 这类参数通常仍交给 AdamW;
- 大 batch、超大模型上的表现仍在验证中,工业界多是"Muon + AdamW 混用"的配方;
- 学习率语义与 Adam 不同,迁移配方时要重调。
学习建议
读两样东西就够入门:Muon 的原始实现(几十行代码,值得手推一遍)+ Adam 与 SGD 的对比基础。面试被问"你了解哪些新优化器",能讲清 Muon 的正交化直觉就赢过 90% 的竞争者。优化器基础考点复习看深度学习面试。