一句话概括:NPO 是介于传统可插拔光模块与 CPO 共封装光学之间的新一代 AI 芯片高速光互联方案,华为在昇腾 960 超节点上全球首个商用落地,用来解决万卡 / 十万卡 AI 集群算力卡之间通信带宽、功耗、延迟瓶颈。
✅ 核心原理传统交换机 / 算力卡:高速电信号要先在 PCB 长距离走线,走到机箱面板上的独立可插拔光模块,再做电光转换。高速电信号长距离铜走线损耗巨大,需要光模块里面自带 DSP(信号补偿芯片),DSP 功耗很高。华为 NPO 的做法:把光引擎搬到距离算力芯片 / 交换机 ASIC 很近(几厘米)的板上,大幅缩短高速电信号铜走线长度;把 DSP 功能直接集成进算力芯片 / ASIC 内部,光引擎里面拿掉独立 DSP;光引擎仍然是独立可拆卸部件,不是和芯片裸片封装在一起。华为自研 NPO 光引擎命名 Hi ONE,7.2Tbps,内置光源,搭载在昇腾 960 超节点上,单超节点最高可扩展 4096 张算力卡,面向十万亿参数大模型训练。整套超节点使用 5500 个 NPO 光引擎,替代原先 48000 个 800G 光模块,整机互联功耗直接下降 550kW 以上。
✅ 核心优势(对比传统光模块 & CPO)和传统面板可插拔光模块对比电信号路径极短,链路时延从约 100ns 降到 10ns 级别去掉光引擎 DSP,互联功耗下降约 60%带宽密度更高,解决高密度算力柜布线拥挤、散热难题和 CPO(共封装光学)对比【NPO 最大卖点】CPO 是光引擎直接和芯片封装在同一个基板上,距离更近,但良率、维修、产业链改造难度极高:光引擎一旦故障,很可能整个高端算力芯片一起报废,运维成本巨大。✅ NPO 光引擎独立可拆卸,坏了单独更换,不用动主算力芯片✅ 对现有产业链改动更小,国内光模块厂商(中际旭创、新易盛、光迅等)可以供货光引擎✅ 工程落地难度远低于 CPO,是当下超大规模智算集群更务实可落地路线
✅ 昇腾 960 超节点整体架构搭配互联协议:灵衢高速互联协议,实现超节点内所有算力卡统一编址,像一台巨型计算机;互连策略:近铜远光,短距离用铜、长距离卡间通信走 NPO 光互联;整机:正交架构 + 全液冷,FP8 算力最高 8EFLOPS;多个超节点互联最大可扩展至51.2 万卡的巨型集群。
✅ 一句话区分三代光互联传统可插拔光模块:光模块在机箱面板,长铜线、带 DSP、高功耗、易维护华为 NPO 近封装光学:光引擎贴紧芯片板上、短铜线、DSP 上移进 ASIC、低功耗 + 可单独维修CPO 共封装光学:光引擎和芯片封装一体、最短走线、功耗最低,但维修极难、工艺门槛极高