OpenAI 公布 Jalapeño 首轮实测:推理基建开始直接为 Agent 而设

OpenAI 公布自研 Jalapeño 推理芯片的首轮结果,称在多个模型和互动工作负载中改善每瓦 AI 工作量及端到端延迟;但数据仍是厂商自报,并未经过独立复现。

OpenAI 于 2026 年 8 月 25 日公布 Jalapeño 的首轮实测结果。这是继 6 月公布与 Broadcom 合作研发定制 AI 芯片之后的新进展,焦点由「正在打造」转到「在测试中表现如何」。OpenAI 表示,Jalapeño 是一款为推理而设的自研芯片,会和内存、网络及软件一同设计,目标是处理对延迟敏感、而且会持续调用工具的互动式 Agent 工作。

OpenAI 使用 SemiAnalysis 公开的 InferenceX 基准,比较 GPT-OSS 120B、DeepSeek R1 670B 及 Kimi K2.5 1T 等模型。按 OpenAI 的测量,Jalapeño 在峰值负载下每瓦可完成多 1.5 至 1.9 倍 AI 工作,端到端延迟则低 1.7 至 3.6 倍;对于互动式工作负载,OpenAI 报告的性能提升为 2.1 至 4.1 倍。这些数字必须理解为 OpenAI 自己的测试结果,而不是已经由独立实验室确认的行业基准。

这次实测的重点不只是芯片本身。OpenAI 说明,InferenceX 会把 prefill、decode、内存访问、网络传输和数据搬运放在同一个用户体验中衡量。对于 Agent 而言,一次工作可能要读取数据、调用工具、等待回复,再生成下一步指令;如果每一个回合都只改善一点点,整条流程的等待时间仍会累积。因此,比单看 token 速度更有意义的是完成一个成功工作所需的延迟、能耗和成本。

OpenAI 也提到,Jalapeño 的额定功耗为 700W,但测得的持续功耗不超过 550W;其比较系统的标示功耗则为 1,200W 和 1,400W。这些功耗和性能比较同样取决于测试配置、模型、软件版本和工作负载,不能直接推论所有模型或生产环境都会得到相同比例的改善。AI 基建的实际收益仍要看部署密度、冷却、网络瓶颈、利用率及每项工作所需的工具调用次数。

另一个有意思的讯号是设计流程。OpenAI 表示,Jalapeño 从架构到 tape-out 只用了九个月,并以 AI 协助部分设计;其中选定的 GPT-OSS 硬件区块按公司说法快 1.5 至 1.8 倍。这是选定区块的结果,不代表整枚芯片或整个模型都由 AI 造成同样提升。它反映的是一条更长远的路线:模型公司可能同时把 AI 用在模型、编译器、硬件设计和运行时优化。

OpenAI 计划在 2026 年底前开始把 Jalapeño 放进自己的计算基建,但目前仍在 qualification、软件成熟和更多模型验证阶段。公司也明确表示会继续使用 NVIDIA 及其他加速器,并不是即时取代现有供应商。对市场而言,真正要观察的是新芯片能否在不同模型、不同工具链和长时间运行中保持结果,而不是一次发布中的最高数字。

Jalapeño 这次更新值得留意,因为它把 Agent 基建的衡量方式拉近真实工作流程:成功率、回合间延迟、每次完成工作的能耗,以及在高峰时段仍能否稳定取得容量。不过,现阶段所有主要性能和部署时间表仍来自 OpenAI 的发布内容,尚未有公开的独立复测。较稳妥的结论是,OpenAI 正尝试把推理硬件和互动 Agent 的需求一起优化,而这个方向仍要由后续部署验证。

MODULE.002 //

更多 Insights

分享网站、AI automation、数码营销、AI news 和 VMTS 公司新闻。