昊梵体育网

AI Infra之框架篇(九)|AFD分离 上一篇主要介绍了 PD 分离,以及如

AI Infra之框架篇(九)|AFD分离
上一篇主要介绍了 PD 分离,以及如何将 Prefill 和 Decode 部署到不同的推理实例,并通过 KV Cache 传输连接两个阶段。

这一篇继续介绍更细粒度的推理分离架构:AFD,也叫 Attention-FFN Disaggregation。

🌟本篇主要介绍:

▪️ Attention 与 FFN 的计算和访存特点
▪️ 为什么 MoE 推理需要进一步拆分 Attention 与 Expert
▪️ AFD 的核心思想与整体架构
▪️ Attention Service 与 FFN Service 分别负责什么
▪️ AFD 中的 KV Cache 存在哪里
▪️ AFD 与 PD 分离有什么区别
▪️ AFD 的收益、适用场景与额外开销
▪️ vLLM AFD Plugin 的架构与相关实现

AFD 的核心思想可以概括为:

将 Transformer 中的 Attention 与 FFN 部署到不同的计算实例。Attention 实例负责请求调度、Attention 计算和 KV Cache 管理,再将当前层的 Hidden States 与路由信息发送给 FFN 实例;FFN 实例执行 Dense FFN 或 MoE Expert 计算,并将结果返回 Attention 实例,继续执行下一层。

在 MoE 场景下,还可以将多个 Attention 副本的 Token 汇聚到共享的 Expert Pool,提高每个 Expert 的有效 Batch,改善小规模矩阵计算下的 GPU 利用率。

下一篇准备介绍通算融合,看看如何将矩阵计算与 AllReduce、ReduceScatter、All-to-All 等通信操作进行重叠或融合,减少大模型分布式推理中的通信等待。

后续也会继续分享 Attention 优化、KV Cache 量化、模型压缩、异构推理等 AI Infra 相关知识。

欢迎大家一起学习、交流,也欢迎指出内容中的问题。

大模型 大模型推理 AIInfra vLLM AFD分离 AttentionFFN MoE 专家并行 分布式推理 通算融合