Jalapeño把推理延迟降至三分之一,但没有挑战训练芯片

OpenAI于2026年8月25日发布首款自研推理芯片Jalapeño的首批公开基准。Axios对发布事件的同期核实 指出,测试覆盖GPT‑OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T;Jalapeño面向模型推理,不用于训练新模型。
直接结论是:Jalapeño在这些指定负载中确实比受测的Nvidia GB200或GB300配置更快、更节能,最佳端到端延迟约为对照的三分之一,峰值单位功耗吞吐量领先1.5至1.9倍。但这是按封装TDP归一化、采用单token预测得到的结果,不能外推为对所有生产负载、Nvidia最新平台或训练任务的全面胜利。
三种同负载测试支持了哪些优势

三组主比较都采用InferenceX的名义8k输入、1k输出和单token预测条件。OpenAI公开的测试附录 列出的结果是:GPT‑OSS 120B上,Jalapeño与GB200的峰值混合吞吐量分别为每千瓦85,448和44,960,端到端延迟为1.03秒和1.80秒;DeepSeek R1上,Jalapeño与GB300分别达到每千瓦19,641和11,781,延迟为1.65秒和5.99秒;Kimi K2.5上,两者分别为每千瓦18,195和11,862,延迟为1.56秒和5.31秒。
- GPT‑OSS 120B:Jalapeño的峰值单位功耗吞吐量约为GB200的1.9倍,端到端延迟降低约1.7倍。
- DeepSeek R1 670B:单位功耗吞吐量约为GB300的1.7倍,端到端延迟降低约3.6倍,是三组测试中幅度最大的延迟优势。
- Kimi K2.5 1T:单位功耗吞吐量约为GB300的1.5倍,端到端延迟降低约3.4倍。
这些结果同时满足更高吞吐量和更低延迟,而不是只在其中一个指标上领先。其证明范围仍然很窄:模型版本、精度格式、上下文长度、输出长度、预测方式和运行点均已固定,改变其中任何条件,都可能改变领先幅度。
峰值吞吐量与最低延迟也不应被拼接成一套实际部署配置。推理系统通常通过批处理和并发提高吞吐量,但更多并发可能增加单次请求等待时间;采购者需要的是完整服务曲线,而不是把各运行点的最佳数字组合成一个不存在的系统状态。
700瓦是封装TDP,不能当作整机功耗

功耗口径是解读结果的关键。Tom’s Hardware对测试条件的核查 显示,主图按封装TDP归一化,Jalapeño、GB200和GB300分别采用700瓦、1,200瓦和1,400瓦;Jalapeño在受测负载中的持续芯片功耗不超过550瓦,而按每个加速器分摊的整机输入功率约为Jalapeño 1.18千瓦、GB300 2.55千瓦,换用整机口径后差距会收窄;同一核查还指出,GB300采用多token预测时,Jalapeño的峰值能效领先缩小至约1.5倍,Vera Rubin没有参测,Jalapeño也不承担模型训练。
封装TDP、持续芯片功耗和整机输入功率是三个不同层级。封装TDP适合按统一额定值归一化,却不等于墙上电表读数;持续芯片功耗描述特定负载下的器件消耗,也没有包含CPU、内存、网络、供电转换和冷却。
因此,首批结果可以支持“受测配置每千瓦完成更多推理工作”,却不能直接给出数据中心容量、每token电费或投资回收期。把芯片层面的比值转化为采购结论,还需要相同机柜密度、利用率、网络拓扑、冗余方式和服务等级下的系统测量。
单token预测保证同条件,但不是唯一生产路径
主比较让Jalapeño和Nvidia系统都采用单token预测,减少了软件策略不同对硬件比较的干扰。在这个意义上,测试回答的是:使用相同预测方式时,哪套受测系统能以更低延迟和更高单位功耗吞吐量完成指定请求。
多token预测则尝试在一次推理步骤中生成多个候选token,可能提高吞吐效率,但其收益取决于接受率、模型质量要求和软件实现。GB300切换到这种路径后差距缩小,说明Jalapeño的领先并非脱离软件栈而独立存在;真正的生产比较应让双方采用各自成熟的优化方案,同时保持输出质量和服务目标一致。
这也解释了为什么厂商峰值数字不能直接等同于线上收益。生产流量包含不同上下文长度、输出长度、并发水平和突发请求,系统还要处理调度、缓存与通信开销;首批公开基准没有覆盖这些分布,也没有给出长期利用率或故障冗余条件。
Vera Rubin与训练仍在结论之外
Jalapeño本轮对照的是Blackwell代的GB200和GB300,并非Vera Rubin。现有证据允许说它领先这些已测试配置,却不足以声称它击败了Nvidia全部最新推理平台;Vera Rubin需要在相同模型、精度、负载、预测方式和功耗口径下参测,才可能进入同一结论。
训练能力的边界更加明确。Jalapeño是为语言模型服务设计的专用推理ASIC,而Nvidia系统可覆盖训练与推理;本次没有训练基准,芯片本身也不以训练新模型为目标,因此延迟和能效优势不能转换成训练性能判断。
截至目前,已确认的是Jalapeño在真实芯片上完成了三种公开权重模型的InferenceX测试,并在规定条件下取得更高的峰值单位功耗吞吐量和更低的端到端延迟。OpenAI接下来仍需提供规模化部署数据、更多生产负载、完整的软件优化对比,以及与Vera Rubin同条件测试,才能回答其优势能否延伸到数据中心总成本与更广泛平台竞争。
订阅我们的新闻通讯
将最新 Web3、AI 和加密货币新闻直接发送到您的邮箱。