在 Hot Chips 2026 大会上,OpenAI 公布了首颗自研推理专用芯片 Jalapeno 的完整架构。这是它与 Broadcom 联合开发的第一颗定制推理加速器,标志着大模型厂商开始把"自己的需求"直接写进硅里。

一颗为推理而生的 ASIC

Jalapeno 采用台积电 3nm 工艺,单封装内集成 6 颗 HBM4 内存堆叠。它定位纯推理加速器——不做模型训练,也不对外销售,只为提升 ChatGPT 与 API 用户的响应速度。从架构设计到流片仅约 9 个月,OpenAI 称其中大量芯片设计验证工作由自己的模型完成。

省电与低延迟是卖点

据 SemiAnalysis 的 InferenceX 基准,Jalapeno 每瓦吞吐量达到英伟达 GB200/GB300 系统的 1.5–1.9 倍,端到端延迟低 1.7–3.6 倍。OpenAI 强调它是对英伟达算力的补充而非替代,计划 2026 年底小规模部署、2027 年放量。

算力竞争换赛道了

过去几年,"谁买的 GPU 多"几乎是算力竞争的全部。当模型厂商开始自研芯片、为自家模型的推理负载专门优化,竞争的抓手就变成了"谁为模型造的芯片更省"——更低的延迟、更高的每瓦吞吐,直接转化为更便宜的服务和更好的体验。对普通用户来说,这类自研芯片短期不会"换牌子",但它会悄悄压低你每次对话的成本。