RankMixer 解读:推荐系统排序模型的 Scaling Law 来了

2026-07-01 · 博客首页

2025 年推荐系统领域最出圈的论文之一,是字节的《RankMixer: Scaling Up Ranking Models in Industrial Recommenders》。它回答了一个困扰工业界多年的问题:推荐排序模型能不能像大模型一样"堆参数换效果"?

背景:排序模型为什么长不大

大语言模型加参数效果稳定提升(Scaling Law),但工业推荐排序模型一直"长不大",原因有二:

  1. 架构瓶颈:传统排序模型以特征交叉(DCN、DIN 一类)为核心,结构复杂但加参数的边际收益很快归零;
  2. 推理预算:排序在线服务对延迟极敏感,参数量涨 = 算力涨 = 成本扛不住。

RankMixer 怎么破局

核心思路:用纯 MLP 的 Mixer 结构替掉复杂组件,为并行化让路。

  • Per-token FFN:把特征分组成 token,各自过 FFN;
  • Multi-head Token Mixing:跨 token 混合信息,替代注意力的角色——纯矩阵乘,硬件效率远高于稀疏的 attention;
  • 稀疏专家 + 并行化设计:配合高并行度的推理实现,做到参数量放大数十倍、单请求推理成本基本不涨。

结果:模型规模上去后,线上指标随参数持续提升——推荐排序也有 Scaling Law 了。该方案在抖音等场景全量上线。

为什么值得读

  1. 它是"生成式推荐"浪潮里判别式排序路线的反驳:不是非要端到端生成,把排序模型本身 scale 起来同样有效;
  2. 对从业者:各大厂的推荐架构正在往 Mixer/MLP 方向演进,面试聊推荐系统前沿,RankMixer 是必备谈资;
  3. 方法论普适:先让架构对硬件友好,再谈 scale——这个思路适用于所有在线服务模型。

想深入推荐方向的求职准备,看推荐系统与生成式推荐和大模型面试考点。

看完想试试?按 Alt+Q 截屏,AI 秒答,答案直达微信。
免费下载 购买次数