返回首页

2026年7月15日

OpenAI 自研 Jalapeño 推理芯片:模型公司为什么开始做基础设施?

OpenAI 与 Broadcom 发布 Jalapeño 推理芯片,称九个月完成流片、年底开始部署。本文区分已确认事实、公司声明与仍缺失的性能证据。

核心要点

  • Jalapeño 是面向大模型推理的专用加速器,不是面向普通消费者的 AI 设备。
  • 官方确认了九个月流片、实验样片和 2026 年底部署方向,但没有公开数字 benchmark。
  • 它真正要改变的是模型服务的成本、延迟和供应链;用户不会因为发布会立刻看到降价。
  • AI 基础设施
  • 模型
从大模型到 Jalapeño 推理芯片、服务系统和用户延迟成本的原创示意图
Original Wesbase diagram

这不是一张新的消费级显卡

OpenAI 与 Broadcom 在 6 月 24 日公布 Jalapeño,称它是 OpenAI 的第一颗面向大模型推理的 Intelligence Processor。官方说法包括:芯片从头围绕大模型推理设计,工程样片已经在目标频率和功耗下运行,并计划在 2026 年底开始部署。

这件事的重要性不在于消费者会买到一颗“OpenAI 显卡”,而在于模型公司开始把注意力伸到推理服务的底层。ChatGPT 的每次回答、Codex 的长任务和 API 的每个 token,最终都要经过数据中心里的计算、内存、网络和调度系统。

先把事实、声明和推断分开

已确认的事实

  • OpenAI 称 Jalapeño 是第一代多代推理平台的一部分,Broadcom 和 Celestica 参与芯片实现、板卡、机架系统和网络等工作。
  • 工程样片已经运行包括 GPT-5.3-Codex-Spark 在内的机器学习工作负载。
  • 官方称从设计到 tape-out 只用了九个月,并计划在 2026 年底开始初始部署。
  • Broadcom 表示平台面向 2026 年开始的 gigawatt 级数据中心部署,并涉及 Microsoft 等合作方。

仍然只是公司的早期测试声明

OpenAI 和 Broadcom 表示,早期测试显示 Jalapeño 的 performance per watt “显著优于”当前先进硬件。但目前没有公开吞吐量、延迟、功耗、显存容量、每 token 成本,也没有第三方复现实验。因此,这可以支持“基础设施方向值得关注”,不能直接支持“ChatGPT 马上更快更便宜”。

仍未公开的关键问题

  • 它与 NVIDIA、AMD 或其他生产级加速器的数字 benchmark。
  • 制程、HBM 代际与容量、TDP、机架拓扑和编译器细节。
  • Jalapeño 是否会作为通用云加速器提供给第三方。
  • 计划中的 gigawatt 级部署究竟服务哪些工作负载,以及何时转化为用户可感知的服务变化。

为什么推理值得单独做芯片?

训练和推理不是同一个问题。训练更强调大规模并行计算;推理则每天处理真实用户请求,既要吞吐量,也要首 token 延迟、持续稳定性和单位成本。一个模型即使只回答几百字,也可能经历权重读取、KV cache 管理、内存搬运、网络通信和多轮工具调用。

Jalapeño 的官方叙事正是围绕这些“没有出现在模型排行榜上的瓶颈”:计算、内存移动、网络和服务系统一起设计。这个方向并不保证结果,但解释了为什么 OpenAI 不满足于只租用通用 GPU。

层级Jalapeño 想优化什么用户最终可能看到什么
模型与内核让硬件更贴合实际算子同样模型下更低延迟
内存与网络减少数据搬运和等待长上下文或 agent 任务更稳定
调度与机架提高设备利用率高峰期更少排队或失败
供应链形成多代专用平台单位 token 成本有下降空间

最后一列都是“可能”,不是已经发生的事实。只有公开服务指标或价格变化出现,才能确认芯片优势是否传递到了产品层。

九个月流片意味着什么?

九个月从设计到制造流片是一个很强的工程信号。官方同时表示,OpenAI 模型帮助加速了芯片设计和优化的一部分。合理推断是,模型能力正在从“运行在硬件上”向“帮助设计运行模型的硬件”延伸。

但这里也有两个边界。第一,流片不等于大规模量产,更不等于大规模稳定交付;第二,“AI 加速芯片设计”不等于芯片已经被 AI 自动设计。制造良率、封装、HBM 供应、网络系统和软件栈仍然决定最终成本与可用性。

对企业来说,专用芯片还有利用率风险:如果模型架构、请求类型或服务调度变化太快,专用设计的优势可能缩小。对开发者来说,更现实的观察点不是芯片型号,而是 API 的延迟、限流、价格、上下文能力和区域可用性有没有同步变化。

读者现在该看哪四个信号?

1. 延迟,而不是发布会上的峰值

关注首 token 延迟、长任务的 p95/p99 延迟,以及高峰期是否稳定。单次演示速度不能代表生产服务。

2. 成本,而不是“性能功耗比”单项指标

如果推理成本下降,最终可能体现在 API 价格、套餐额度、免费层配额或企业合同上。没有这些变化前,不要把性能功耗比直接换算成用户省钱。

3. 可靠性和区域覆盖

年底部署计划不等于所有地区都能使用。看服务状态、限流策略、模型路由和故障恢复,比看“gigawatt”更接近开发者实际体验。

4. 是否开放给更广泛的模型与云平台

官方称 Jalapeño 面向行业内当前和未来的 LLM,但这不是已经开放销售的承诺。未来是否会被第三方使用,取决于软件栈、供应量、商业模式和 OpenAI 自身的容量需求。

FAQ

Jalapeño 会替代 NVIDIA GPU 吗?

目前没有证据支持这个结论。它是面向推理的专用加速器,可能与通用 GPU 形成互补;在公开 benchmark、量产规模和真实工作负载数据出现前,不能判断谁会替代谁。

它和 Codex Micro 是同一个硬件项目吗?

不是。Jalapeño 是数据中心推理芯片;Codex Micro 是此前预告的开发者输入设备。两者都属于 OpenAI 扩展硬件边界,但面向的用户、时间表和技术问题不同。

什么时候会影响普通用户?

最早可能通过延迟、稳定性、模型可用性或价格间接体现,但具体时间未知。官方目前只确认工程样片和 2026 年底的初始部署方向。

结论:先把它看成基础设施路线图

Jalapeño 说明 OpenAI 正在从“模型公司”向“模型、产品和基础设施一体化公司”移动。这个战略可能帮助它控制推理成本和延迟,也可能带来专用硬件的制造、供应链和利用率风险。

对开发者和企业而言,今天最稳妥的判断是:它值得跟踪,但还不是可以据此改写预算或迁移架构的性能结论。等公开 benchmark、生产部署和服务指标出现,再用延迟、价格、可靠性和可用性验证这颗芯片是否真的改变了 AI 的日常成本。

图片与信源说明

封面是 Wesbase 原创示意图,没有使用 OpenAI、Broadcom 或媒体摄影。事实来源包括 OpenAI 官方公告、Broadcom 投资者关系公告和 Broadcom 产品新闻页;Tom’s Hardware 用于补充芯片封装与缺失 benchmark 的技术分析。文章中关于用户收益、供应链和利用率的内容均明确标为推断或未知,不把公司早期测试口径写成独立测量结果。

来源与延伸阅读

  1. https://openai.com/index/openai-broadcom-jalapeno-inference-chip/
  2. https://investors.broadcom.com/news-releases/news-release-details/openai-and-broadcom-unveil-llm-optimized-intelligence-processor
  3. https://www.broadcom.com/company/news/product-releases
  4. https://www.tomshardware.com/tech-industry/artificial-intelligence/broadcom-and-openai-unveil-custom-built-jalapeno-inference-processor-openais-first-chip-is-a-massive-reticle-sized-asic-built-in-an-ultra-fast-nine-month-development-cycle