OpenAI 自研推理芯片 Jalapeño 首测:推理性能最高快 3.6 倍、功耗减半,年底部署
8 月 25-26 日 OpenAI 公布首款自研推理芯片 Jalapeño(墨西哥辣椒)测试结果:在 GPT-OSS 120B、DeepSeek R1 等模型负载下,推理性能较英伟达 GB300 最高快 3.6 倍,每瓦工作量提升 1.5-1.9 倍,功耗仅约一半;芯片由 GPT-Astra 辅助设计,从设计到流片仅 9 个月,计划年底小规模部署。
核心结论
推理效率成为头部实验室的新军备竞赛:OpenAI 自研 ASIC、Anthropic 收购 Decart、谷歌自研 TPU,方向一致而路径不同。
「AI 设计芯片」从实验走向实战:GPT-Astra 辅助下 9 个月流片,可能重塑芯片设计流程。
算力供给多元化长期利好开发者:API 价格与选择空间都会扩大,但短期 API 定价不受影响。
一、事件回顾:8 月 25 日晚间的测试公布
8 月 25 日晚间(国内 8 月 26 日广泛报道),OpenAI 公布了首款自研推理芯片 Jalapeño(中文社区称「墨西哥辣椒」/「辣椒芯」)的测试结果。该芯片与博通(Broadcom)合作开发,采用 ASIC 架构,专为大模型推理设计,目标是在提升吞吐量的同时降低响应延迟。
测试覆盖 GPT-OSS 120B、DeepSeek R1 等主流开源与推理模型负载,对比对象是英伟达 GB300。结果显示:交互式工作负载下推理性能最高提升 3.6 倍,每瓦工作量提升 1.5-1.9 倍,响应延迟降低 1.7-3.6 倍,功耗约为英伟达方案的一半。
更值得关注的是研发周期:从设计到流片只用了 9 个月,且全程由 GPT-Astra(OpenAI 自研智能体)辅助完成芯片设计——这也是「AI 设计芯片」首次在旗舰级推理 ASIC 上得到实战验证。
二、为什么推理芯片突然成为焦点
大模型成本结构正在从训练转向推理:ChatGPT 等产品的推理调用量随用户增长非线性上升,Agent 任务单次执行要消耗数十上百次模型调用。对 OpenAI 而言,推理成本直接决定 API 定价与免费额度政策,也决定毛利率。
Jalapeño 的定位不是替代英伟达训练卡,而是专攻推理:在已训练好的模型上做高吞吐、低延迟、低功耗的服务。若年底小规模部署、2027 年扩大产量,OpenAI 对英伟达的推理算力依赖将显著下降,也为其「按能力定价」争取更多空间。
这与 Anthropic 洽谈 60 亿美元收购 Decart(GPU/TPU/Trainium 优化)、谷歌自研 TPU 的路线形成对照:头部实验室都在把「推理效率」变成自己的核心工程资产。
三、对开发者和行业的影响
短期影响有限:Jalapeño 年底才小规模部署,2027 年才扩大产量,API 价格与能力在接下来数月内不会因此变化。
中期值得关注两点:一是推理成本下降能否传导为 API 降价或更高的免费额度——OpenAI 6 月已启动首轮大规模 API 降价,芯片落地后可能加速;二是「AI 设计芯片」的范式扩散,GPT-Astra 的 9 个月流片纪录可能推动更多实验室采用类似流程。
对英伟达而言,Jalapeño 与 Groq、Cerebras、亚马逊 Trainium 等构成多重压力;但对开发者,算力供给多元化长期是利好——价格与选择都会变多。
四、需要注意的边界
测试数据来自 OpenAI 自测口径,覆盖负载与对比配置是否公允需第三方复现验证;「快 3.6 倍」是交互式工作负载下的峰值,并非所有场景一致。
ASIC 只跑推理,训练仍依赖英伟达/谷歌等;且 ASIC 灵活度低,模型架构大幅变化时芯片可能快速过时,量产决策有押注成分。
9 个月流片周期含 GPT-Astra 辅助设计,但最终良率、量产成本与性能一致性尚未公开,一切以 OpenAI 官方后续披露为准。
常见问题
Jalapeño 是什么?
OpenAI 首款自研推理芯片,与博通合作开发的 ASIC,专为大模型推理设计,8 月 25-26 日公布测试结果,计划年底小规模部署、2027 年扩大产量。
它真的比英伟达强吗?
OpenAI 自测口径:交互式推理负载下性能最高快 3.6 倍、功耗约一半、每瓦工作量提升 1.5-1.9 倍;结论需第三方复现验证。
对普通用户有什么影响?
短期无影响;中期若推理成本下降,可能体现为 API 降价或更高免费额度。