瑞银——美国半导体:2026年AI基础设施峰会纪要
瑞银指出,市场严重低估了英伟达(NVDA)在系统级整合上的护城河,同时内存瓶颈正在成为制约AI算力扩张的最大掣肘。随着超大规模云厂商(Hyperscalers)借助AI工具加速自研ASIC(专用集成电路)的部署周期,整个AI基础设施的竞争格局正从单纯的算力堆叠,转向以“系统级总拥有成本(TCO)”为核心的精细化博弈。
一、 推理需求无底洞与硬件通用性的两难
当前推理(Inference)需求呈现“无法满足”的态势,但运营者面临的核心矛盾在于:必须在优化当前大模型代际的每Token成本(Cost/Token)与保留未来支持未知工作负载的硬件通用性(Fungibility)之间做出权衡。这种“优化与灵活性的张力”正主导下一代AI基础设施的设计。除了NVDA,市场正密切关注Cerebras(CBRS)、SambaNova和Etched等新兴推理加速方案的崛起。
二、 优化重心全面向系统级转移
单纯的算力堆叠已触及瓶颈。由于内存带宽(Memory Bandwidth)、内存容量及存储成为新的限制因素,行业焦点正转向提升整个系统的综合利用率。如果系统其他部分无法喂饱加速器(Accelerators),增加再多算力也无济于事。所谓的“内存墙(Memory Wall)”是本届峰会最高频的词汇,解决路径包括提升Scale-up(纵向扩展)网络的吞吐量、降低延迟以及采用新型计算架构。
三、 网络互联在推理中的权重急剧上升
随着推理工作负载变得更加分散且对延迟极度敏感,在加速器和内存之间高效移动数据变得与计算本身同等重要。更好的网络互联能直接提升加速器利用率,进而压低每Token成本。关键趋势是:超大规模云厂商不再满足于单一协议,Scale-up市场正从“赢家通吃”转向多协议并存。
具体来看,基于以太网的ESUN(注:可能指增强型超以太网联盟方案)通过缩短报头解决了历史延迟问题,被视为可靠的Scale-up替代方案;NVLink仍是非以太网阵营中最成熟的选择;而UALink(Ultra Accelerator Link)作为后起之秀也备受关注。在UALink的专题讨论中,谷歌(Google)工程师证实,尽管GCP(谷歌云平台)广泛采用OCS(光电路交换)方案,但正在评估将UALink用于特定延迟敏感的推理场景(初期为小规模特定部署)。
四、 CXL技术成为DDR4生命周期的“续命”良药
本次峰会的一个显著趋势是,超大规模云厂商正在利用CXL(Compute Express Link)技术将DDR4内存扩展到仅支持DDR5的最新CPU上。Meta(META)的数据极具说服力:目前43%的服务器受限于内存瓶颈,且69%的碳足迹与内存DIMM相关。由于DIMM的生命周期通常是CPU的2倍以上,通过CXL桥接DDR4,可以有效减少昂贵的DDR5用量。尽管CXL会引入额外延迟,但测试表明,只要CXL连接的DDR4占比控制在系统总内存的1/4左右,就能通过系统级调度有效隐藏延迟,性能表现与本地内存相当。这是系统级经济性的又一典型案例。
五、 AI正在压缩芯片研发与部署周期
AI工具正在颠覆传统的芯片设计流程,工程师得以将原本串行的设计步骤并行化,大幅缩短开发时间。但更快的设计周期对部署速度提出了更高要求。AWS(亚马逊云科技)介绍了一种激进的部署策略:在芯片流片回来之前,先部署和测试整个机架系统,最后一步才将计算芯片“插入”系统。这种方法将传统的约9个月爬坡期压缩到了“几周”级别。这揭示了一个二阶效应:仅仅更快地设计出下一代芯片是不够的,整个基础设施堆栈必须准备好迎接远超以往的产品迭代节奏。