首页AI 资讯OpenAI 自研推理芯片 Jalapeño 首测:推理性能最高快 3.6 倍、功耗减半,年底部署
OpenAI 自研推理芯片 Jalapeño 首测:推理性能最高快 3.6 倍、功耗减半,年底部署 封面
技术前沿2026-08-257 分钟

OpenAI 自研推理芯片 Jalapeño 首测:推理性能最高快 3.6 倍、功耗减半,年底部署

8 月 25-26 日 OpenAI 公布首款自研推理芯片 Jalapeño(墨西哥辣椒)测试结果:在 GPT-OSS 120B、DeepSeek R1 等模型负载下,推理性能较英伟达 GB300 最高快 3.6 倍,每瓦工作量提升 1.5-1.9 倍,功耗仅约一半;芯片由 GPT-Astra 辅助设计,从设计到流片仅 9 个月,计划年底小规模部署。

OpenAIJalapeño推理芯片英伟达ASIC算力

核心结论

推理效率成为头部实验室的新军备竞赛:OpenAI 自研 ASIC、Anthropic 收购 Decart、谷歌自研 TPU,方向一致而路径不同。

「AI 设计芯片」从实验走向实战:GPT-Astra 辅助下 9 个月流片,可能重塑芯片设计流程。

算力供给多元化长期利好开发者:API 价格与选择空间都会扩大,但短期 API 定价不受影响。

一、事件回顾:8 月 25 日晚间的测试公布

8 月 25 日晚间(国内 8 月 26 日广泛报道),OpenAI 公布了首款自研推理芯片 Jalapeño(中文社区称「墨西哥辣椒」/「辣椒芯」)的测试结果。该芯片与博通(Broadcom)合作开发,采用 ASIC 架构,专为大模型推理设计,目标是在提升吞吐量的同时降低响应延迟。

测试覆盖 GPT-OSS 120B、DeepSeek R1 等主流开源与推理模型负载,对比对象是英伟达 GB300。结果显示:交互式工作负载下推理性能最高提升 3.6 倍,每瓦工作量提升 1.5-1.9 倍,响应延迟降低 1.7-3.6 倍,功耗约为英伟达方案的一半。

更值得关注的是研发周期:从设计到流片只用了 9 个月,且全程由 GPT-Astra(OpenAI 自研智能体)辅助完成芯片设计——这也是「AI 设计芯片」首次在旗舰级推理 ASIC 上得到实战验证。

二、为什么推理芯片突然成为焦点

大模型成本结构正在从训练转向推理:ChatGPT 等产品的推理调用量随用户增长非线性上升,Agent 任务单次执行要消耗数十上百次模型调用。对 OpenAI 而言,推理成本直接决定 API 定价与免费额度政策,也决定毛利率。

Jalapeño 的定位不是替代英伟达训练卡,而是专攻推理:在已训练好的模型上做高吞吐、低延迟、低功耗的服务。若年底小规模部署、2027 年扩大产量,OpenAI 对英伟达的推理算力依赖将显著下降,也为其「按能力定价」争取更多空间。

这与 Anthropic 洽谈 60 亿美元收购 Decart(GPU/TPU/Trainium 优化)、谷歌自研 TPU 的路线形成对照:头部实验室都在把「推理效率」变成自己的核心工程资产。

三、对开发者和行业的影响

短期影响有限:Jalapeño 年底才小规模部署,2027 年才扩大产量,API 价格与能力在接下来数月内不会因此变化。

中期值得关注两点:一是推理成本下降能否传导为 API 降价或更高的免费额度——OpenAI 6 月已启动首轮大规模 API 降价,芯片落地后可能加速;二是「AI 设计芯片」的范式扩散,GPT-Astra 的 9 个月流片纪录可能推动更多实验室采用类似流程。

对英伟达而言,Jalapeño 与 Groq、Cerebras、亚马逊 Trainium 等构成多重压力;但对开发者,算力供给多元化长期是利好——价格与选择都会变多。

四、需要注意的边界

测试数据来自 OpenAI 自测口径,覆盖负载与对比配置是否公允需第三方复现验证;「快 3.6 倍」是交互式工作负载下的峰值,并非所有场景一致。

ASIC 只跑推理,训练仍依赖英伟达/谷歌等;且 ASIC 灵活度低,模型架构大幅变化时芯片可能快速过时,量产决策有押注成分。

9 个月流片周期含 GPT-Astra 辅助设计,但最终良率、量产成本与性能一致性尚未公开,一切以 OpenAI 官方后续披露为准。

常见问题

Jalapeño 是什么?

OpenAI 首款自研推理芯片,与博通合作开发的 ASIC,专为大模型推理设计,8 月 25-26 日公布测试结果,计划年底小规模部署、2027 年扩大产量。

它真的比英伟达强吗?

OpenAI 自测口径:交互式推理负载下性能最高快 3.6 倍、功耗约一半、每瓦工作量提升 1.5-1.9 倍;结论需第三方复现验证。

对普通用户有什么影响?

短期无影响;中期若推理成本下降,可能体现为 API 降价或更高免费额度。

可核验来源

相关工具

相关阅读

技术前沿

ChatGPT 全量推送 GPT-6 + Intelligent UI:聊天框从「对话框」变成「即时应用容器」

OpenAI 于 10 月 7 日起把 GPT-6 Sol 推送给 ChatGPT Plus/Pro/Business/Enterprise,10 月 8 日把 GPT-6 Luna 推送给 Free/Go 用户——这是 GPT-6 第一次进入 ChatGPT 主聊天默认模型。更大的变化是同步上线的 Intelligent UI:模型回答不再只是文字,会在文本里嵌入可点击按钮、表单、图表、计算器乃至小游戏,组件随生成流式呈现。官方覆盖每周 12 亿+周活用户。百器AI 未实测,本文区分官方口径、Deployment Safety Hub 报告与第三方转述,并提示工作区版 / Work / Codex 不在本次切换范围内。

技术前沿

Qwen3.8-Max-0902 快照版解析:CodeArena 前端编程登顶之外,快照机制才是开发者更该关注的事

9 月 2 日阿里将旗舰模型 Qwen3.8-Max 升级至 0902 快照版:官方围绕编程与专业办公后训练,第三方榜单 CodeArena 中提升 22 分至 1691 分登顶前端编程总榜,每百万 Tokens 综合均价约 5 美元(榜单口径),9 月 5 日起 qwen3.8-max 指针自动切换且价格不变。本文拆解「榜单第一」的实际含义、快照锁定对生产系统的意义,以及与 Qwen4 路线图的关系。百器AI 未实测,全文基于官方口径与三家媒体交叉核验。

技术前沿

华为 openPangu-2.0 训练栈开源收官:从「开放权重」到「开放全流程」,国产大模型补上最后一块拼图

9 月 28 日华为开源盘古 openPangu-2.0 的预训练、SFT 代码(openPangu-2.0-Training)与后训练 RL 代码(openPangu-2.0-RL,基于 VERL 生态、支持 GSPO/GRPO),至此 6 月预告的 7 大组件分阶段开源收官——权重、推理代码、训推算子之外,把千亿参数规模上验证过的完整训练管线也交了出去。同一周 Anthropic、OpenAI、Google 三连发全部把最强能力锁进 API 或分阶段分发,华为反向操作。但需要清醒:训练栈针对昇腾原生优化(官方技术报告口径,非昇腾硬件适配性未披露)、全部性能数字无第三方复现、技术报告自认在复杂软件工程任务上与第一梯队仍有差距。百器AI 未实测。