RankMixer 解读:推荐系统排序模型的 Scaling Law 来了
2026-07-01 · 博客首页
2025 年推荐系统领域最出圈的论文之一,是字节的《RankMixer: Scaling Up Ranking Models in Industrial Recommenders》。它回答了一个困扰工业界多年的问题:推荐排序模型能不能像大模型一样"堆参数换效果"?
背景:排序模型为什么长不大
大语言模型加参数效果稳定提升(Scaling Law),但工业推荐排序模型一直"长不大",原因有二:
- 架构瓶颈:传统排序模型以特征交叉(DCN、DIN 一类)为核心,结构复杂但加参数的边际收益很快归零;
- 推理预算:排序在线服务对延迟极敏感,参数量涨 = 算力涨 = 成本扛不住。
RankMixer 怎么破局
核心思路:用纯 MLP 的 Mixer 结构替掉复杂组件,为并行化让路。
- Per-token FFN:把特征分组成 token,各自过 FFN;
- Multi-head Token Mixing:跨 token 混合信息,替代注意力的角色——纯矩阵乘,硬件效率远高于稀疏的 attention;
- 稀疏专家 + 并行化设计:配合高并行度的推理实现,做到参数量放大数十倍、单请求推理成本基本不涨。
结果:模型规模上去后,线上指标随参数持续提升——推荐排序也有 Scaling Law 了。该方案在抖音等场景全量上线。
为什么值得读
- 它是"生成式推荐"浪潮里判别式排序路线的反驳:不是非要端到端生成,把排序模型本身 scale 起来同样有效;
- 对从业者:各大厂的推荐架构正在往 Mixer/MLP 方向演进,面试聊推荐系统前沿,RankMixer 是必备谈资;
- 方法论普适:先让架构对硬件友好,再谈 scale——这个思路适用于所有在线服务模型。
想深入推荐方向的求职准备,看推荐系统与生成式推荐和大模型面试考点。