AI 推理中的 GPU 利用率越来越受到内存访问的限制,而不是原始计算能力。
随着 KV 缓存增长到数百 GB,HBM 变得过于昂贵而无法进一步扩展,而 NVMe 则引入了过多的延迟。
Marvell 的 Photonic Fabric 通过启用相距最远 30 米的 AI 机架间的光学共享内存,创建了一个新的内存层级。
它提供约 350 ns 近 NUMA 延迟和每个模块 7.2 Tbps 的带宽。这使得容量能够独立于计算进行扩展,同时将热缓存保持在加速器附近。
这种方法通过提高利用率和令牌效率,而无需将每个字节强制放入稀缺的 HBM 中,来解决下一代推理中的核心瓶颈。
光学内存结构正在成为一种实用的方式,重塑 AI 基础设施如何处理大型上下文和长时间运行的代理式工作负载。
