昊梵体育网

# OpenAI Jalapeño:推理芯片开始为“状态留在原地”而设计 信源:Semi Doped|Austin、Vik 解读 OpenAI Jalapeño 与 Hot Chips 2026 演讲|2026-08-28 Jalapeño最容易被记住的,是两个足够抢眼的数字:从首版RTL到tape-out约九个月;在OpenAI公布的InferenceX测试中,它对GB200、GB300展现出明显的

OpenAI Jalapeño:推理芯片开始为“状态留在原地”而设计

信源:Semi Doped|Austin、Vik 解读 OpenAI Jalapeño 与 Hot Chips 2026 演讲|2026-08-28

Jalapeño最容易被记住的,是两个足够抢眼的数字:从首版RTL到tape-out约九个月;在OpenAI公布的InferenceX测试中,它对GB200、GB300展现出明显的性能功耗与延迟优势。但如果只把这件事理解为“OpenAI用AI造出了一颗能打败Blackwell的ASIC”,反而会错过它最值得关注的部分。

这颗芯片提出了一套不同的推理系统经济学:模型状态,尤其是不断膨胀的KV cache,应尽量留在产生和使用它的位置;面对prefill、draft、verify、MoE通信等不断变化的负载,不要频繁把状态搬到不同类型的加速器,而是让同一颗平衡型芯片改变被激活的计算、内存和网络资源。Jalapeño要消灭的并非某一种运算,而是推理系统里长期被低估的三种“税”——数据搬运、资源争用与设备闲置。

HBM给出上限,状态本地性决定能兑现多少

OpenAI把优化目标定为端到端完成一次请求所需的时间,以及每次请求消耗的能量,而不是孤立地比较峰值FLOPS或首token延迟。在GPT‑OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T三个公开模型上,公司报告Jalapeño在峰值吞吐处可提供约1.5—1.9倍的单位功耗工作量,端到端延迟低约1.7—3.6倍。更有意思的是,700W的额定功耗在这些负载下持续功耗不高于550W。[OpenAI公布的完整口径]至少说明,首代芯片已经进入一线推理平台的竞争范围。

它的架构解释比跑分更重要。Hot Chips演讲披露,单颗Jalapeño配有216 GiB HBM4和15.4 TB/s带宽;128颗芯片汇总后,理论HBM带宽超过1 PB/s。按照只读取模型权重的理想化估算,一个万亿参数、4 bit权重的模型本应达到每用户每秒1000—2000 token,叠加推测解码甚至可到5000—10000 token。然而现实系统离这一天花板很远。

原因不是HBM不够快,而是operand经常没有在计算单元需要它时抵达。统一内存系统中的争用、跨核心访问、全局同步、权重复制和在途数据,会同时让计算与内存停下来等待。Jalapeño因而采用类似NUMA的布局:给计算核心配置本地HBM slice和低延迟专用路径,常见collective走快速网络,非规则通信再交给通用NoC。所谓“状态本地化”,就是由编译器和运行时明确决定权重、KV cache与计算任务放在哪里,使高频访问尽量落在本地,减少远端读取与全局协调。

这也给“token throughput约等于HBM容量乘以HBM带宽”补上了一个关键变量。容量和峰值带宽决定理论上限,可实现带宽、数据局部性以及同步开销,决定这个上限有多少能变成可售卖的token。Jalapeño并未削弱HBM的重要性——216 GiB HBM4本身已经足够激进——但它说明下一阶段的竞争不会只围绕更多GB和更高TB/s,增量价值还会迁移到内存控制器、NoC、collective、编译映射和调度系统。

“暗硅”为什么可能比一排闲置加速器便宜

Agent推理并非固定配方。长提示词提高prefill占比,低延迟交互需要小批次draft,speculative decoding又会改变draft与verify的比例,MoE还带来突发的expert通信。若为每个阶段配置不同硬件,理论上可以让每颗芯片更专用,现实中却很难保证所有设备同时满载;负载比例一变,一部分GPU或LPU就可能闲置,KV状态还要在系统间迁移。

Jalapeño的回答是“dark silicon is cheaper than idle accelerators”。它在一颗芯片内同时配置相对均衡的计算、内存和I/O,当前阶段用不到的模块直接power-gating。多出来但暂时断电的晶体管会占用die area,却无需承担另一颗独立加速器的封装、HBM、I/O、网络和基础功耗。视频中提到的“regret factor”也是同一逻辑:在模型架构高速变化时,为未来负载预留一点硬件通用性,成本可能低于一两年后发现整套专用系统无法适配新模型的机会损失。

这解释了Jalapeño为什么既是专门面向LLM inference的ASIC,又能运行多种外部模型。通用性首先是一份面向OpenAI自身模型路线的保险,并不意味着公司一定会把芯片对外销售。若成为商用芯片供应商,OpenAI还要承担第三方软件兼容、客户支持、供货承诺和渠道成本,反而会稀释第一方全栈优化带来的优势。

不过,OpenAI的路线并没有终结异构推理。NVIDIA的Vera Rubin + Groq 3 LPX选择了另一种切法:KV cache和decode attention留在HBM GPU,FFN交给SRAM LPU,每个token只交换中间activation;NVIDIA给出的目标负载已经扩展到400K context,而不是Jalapeño当前公开测试所用的8K输入、1K输出。[NVIDIA的架构说明]表明,它同样在主动避免搬运KV cache。

因此,最终胜负取决于一个可测量的分界线:专用引擎带来的效率增益,能否长期大于额外设备、激活传输和调度复杂度。如果负载比例持续剧烈变化,Jalapeño的同质资源池更有吸引力;如果阶段边界稳定且SRAM对FFN的加速足够大,异构系统仍可能胜出。

Broadcom获得的不是一张普通ASIC订单

Jalapeño还重新划分了模型公司与半导体公司的边界。OpenAI掌握真实请求的长度、并发、模型结构、KV行为和用户可接受延迟,这些数据决定芯片应该长成什么样;Broadcom则负责把这种工作负载认知变成可制造、可联网、可规模部署的系统,覆盖silicon implementation、接口与Tomahawk网络;Celestica承接板卡、机架和系统集成。AI实验室拥有架构意图,传统半导体平台拥有工业化能力,两者之间并不是简单的“客户给规格、供应商交芯片”。

OpenAI与Broadcom已宣布10GW、多代际部署计划,目标从2026年下半年开始、到2029年完成,而且机架的scale-up与scale-out均采用Broadcom Ethernet。Jalapeño的本地scale-up域覆盖128颗芯片,更大的域可扩展到2048颗、跨越多个机架。这意味着Ethernet不再只承担传统的rack-to-rack scale-out流量,而开始进入直接决定模型并行效率的scale-up执行路径。[双方公告]也由此把Broadcom的价值从ASIC设计服务,扩展到交换芯片、SerDes、网络系统和长期平台协同。

对光通信产业而言,重要变化不是立即猜某一家模块供应商,而是scale-up的物理边界正在越过单机架。低延迟域一旦跨架,铜互连的距离与功耗约束会加速暴露,光链路更可能进入直接影响HBM和计算单元利用率的执行路径,而不再只是数据中心外围的带宽配套。

但OpenAI目前没有披露具体采用可插拔、NPO还是CPO,也没有公布光端口数量。现阶段能确认的是需求变量发生了变化,不能把它提前升级成确定的供应商订单。

九个月流片,是起点而不是终局

视频把九个月周期称为整个芯片行业的wake-up call,这个方向成立,但力度需要收敛。OpenAI使用内部模型与XLS加速实现搜索、RTL迭代和验证反馈,后续还用Codex优化kernel;官方披露,部分attention与MoE block的AI生成实现比既有专家版本快1.5—1.8倍,但这只是选定模块,不是整颗芯片或完整模型的同等幅度提升。

更重要的是,这个项目同时拥有前Google TPU团队、Broadcom的后端实现能力、第一方工作负载数据和充足资本。它证明AI可以压缩设计循环,却没有证明一支普通小团队已经能在九个月内复制Rubin级平台。

AI越能自动生成RTL与搜索PPA,瓶颈越会向规格定义、验证覆盖、物理收敛、先进封装、HBM供给、系统可靠性、软件成熟度和量产运维迁移。这甚至可能增加EDA与设计服务的总需求:单个项目的人力门槛下降,会带来更多定制芯片和更快代际迭代,但每一次流片仍要经过昂贵而严苛的签核。最稀缺的资产,也将从“会不会写RTL”转向“是否拥有真实负载反馈,以及能否把反馈快速闭环到芯片和编译器”。

现在仍不能用Jalapeño宣判GPU时代结束。OpenAI的数据来自公司主导的早期测试,使用8K/1K context、按芯片额定功耗归一化,对手是GB200/GB300,而同代Vera Rubin已提供HBM4、最高288GB容量和22 TB/s带宽;OpenAI自己也承认仍在做production qualification、软件成熟和大规模运行验证,并计划继续大量部署NVIDIA等合作伙伴的加速器。更公平的比较,应当是Jalapeño与Rubin在长上下文、混合Agent负载、完整机架功耗、尾延迟和持续可靠性上的正面对决。

因此,接下来最值得追踪的并非又一张峰值曲线,而是Jalapeño在128K—1M context下能否维持Pareto优势,以及Gen 2能否按期扩大其在OpenAI实际推理中的占比。如果这两点成立,Jalapeño的历史意义将不只是多了一颗自研ASIC,而是证明模型公司可以把最私有的工作负载知识固化为芯片和网络架构,让AI基础设施的竞争从“谁拥有更多峰值算力”,推进到“谁能少搬一次数据、少空转一台设备”。