OpenAI公布Jalapeño芯片实测,对标英伟达
OpenAI首次披露自研推理芯片Jalapeño的详细测试结果,称其在三款大型开放模型上兼顾低延迟与能效优势。
从预告走向实测
OpenAI公布了自研推理加速器Jalapeño的首批详细性能数据。这款芯片由OpenAI与博通共同开发;测试采用公开的InferenceX基准,覆盖GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T,并考察高吞吐及低延迟等不同运行状态下的完整推理系统。
按照OpenAI给出的结果,Jalapeño在峰值吞吐状态下,每瓦完成的工作量是英伟达GB200或GB300对照系统的1.5至1.9倍,端到端延迟降低至后者的约三分之一至五分之三;在强调交互速度的配置下,性能优势达到2.1至4.1倍。以Kimi K2.5为例,其峰值每瓦性能约高出1.5倍,端到端延迟则低3.4倍。
测试按芯片公开标称功耗进行归一化:Jalapeño为700瓦,GB200为1200瓦,GB300为1400瓦。OpenAI称,Jalapeño在相关任务中的持续实测功耗不超过550瓦。不过,这些数据仍由厂商自行发布,量产后的稳定性、软件成熟度和系统总成本尚未获得独立验证。
争夺推理成本的控制权
Jalapeño通过让模型状态和KV缓存尽可能靠近计算资源,并协同设计计算、内存与网络,兼顾提示词处理和逐词生成。OpenAI还表示,AI辅助工程把芯片从初始设计推进到流片只用了九个月;在部分注意力和混合专家模块上,AI生成的实现比专家编写版本快1.5至1.8倍,但这一数据并不代表整套模型性能。
OpenAI计划在年底前把Jalapeño部署到自有计算基础设施,同时继续采购英伟达等厂商的加速器。它的重要性在于,一旦自研芯片在规模化运行中兑现指标,OpenAI便可能降低推理边际成本、缩短智能体连续操作的等待时间,并增强与上游硬件供应商谈判的筹码。真正需要观察的,是量产后的利用率、良率和实际运营成本。