昊梵体育网

[LG]《ROCS: Request-Oriented Compute Shar

[LG]《ROCS: Request-Oriented Compute Sharing for Efficient Large-Scale Recommendation》Y Chen, L Luo, B Zhang, J Jiao… [Meta AI] (2026)

在推荐系统领域,模型精度随参数规模提升,但受限于在线推理的算力成本与延迟瓶颈。过去的方法受困于模型蒸馏或链路精简,本质原因是传统架构过早地融合了请求侧与候选侧特征,导致同一用户的重复信息在面对成千上万个候选物时被机械性地重算,产生了巨大的结构化计算冗余。

本文的核心洞见是:将推荐推理重新看作一种非对称的依赖结构,并建立算子级的依赖契约。通过通用层掩码技术隔离请求侧路径,配合深度交叉注意力机制实现按需交互,这种设计使模型核心部分仅需执行一次即可被全体候选共享。同时,内核级广播优化技术在不增加内存负担的前提下,完成了请求与候选特征的物理对齐。

这项工作真正留下的遗产是打破了推荐模型规模与推理成本的线性绑定,在 Meta 生产环境实现了最高 3 倍的吞吐提升。它为后来者打开的新门是利用请求侧的算力摊销来持续探索更深、更复杂的模型规模定律,但尚未跨过的门槛是该范式在低候选场景下的收益稀释,以及对特定硬件底层原语的高度依赖。

arxiv.org/abs/2607.27744 机器学习 人工智能 论文 AI创造营