这次 OpenAI 没有发布新模型,而是公布了一组可能影响未来 AI 调用成本的数据。
2026 年 8 月 25 日,OpenAI 首次披露自研推理芯片 Jalapeño 的实测成绩。
需要注意一个细节:Jalapeño 此前已经对外公布,这次是首次发布可量化的性能测试结果,并不是芯片第一次亮相。
按照 OpenAI 公布的数据,Jalapeño 在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 三个公开模型上,都实现了更高的单位功耗吞吐量和更低的端到端延迟。
这件事对普通 API 用户有什么影响?
简单来说,它可能同时影响三个方面:
- 模型响应速度
- 高峰期可用容量
- 每次推理的基础成本
但“芯片能效提高”并不等于“API 马上降价”。中间还有部署规模、数据中心、电力、研发成本和市场策略等多层因素。
下面具体分析。
一、Jalapeño是什么?
Jalapeño 是 OpenAI 第一代自研 AI 推理芯片。
它的主要任务不是训练下一代基础模型,而是运行已经训练完成的模型,也就是“推理”。
当我们通过 API 发送请求时,后台大致会经历两个阶段:
Stage 1: Prefill
Read and process user input, system prompts, history, and document content.
Stage 2: Decode
Generate the reply token by token based on the preceding context.
Prefill 通常更加依赖计算能力,而 Decode 对显存带宽、KV Cache 和芯片间通信更加敏感。
传统加速器需要同时兼顾训练、推理、图形计算和不同类型的工作负载。Jalapeño 则从一开始就围绕大语言模型推理和交互式 Agent 设计。
OpenAI 希望通过联合设计以下组件,减少系统中的等待和数据搬运:
Model
↓
Inference software
↓
Chip compute units
↓
Memory and KV Cache
↓
Inter-chip network
↓
Rack-level system
这类垂直整合的核心目标,并不是单纯追求某一个跑分,而是在延迟、吞吐量、功耗和成本之间找到更好的平衡。
二、官方公布了哪些关键数据?
OpenAI 使用 SemiAnalysis 推出的公开基准 InferenceX 进行测试。
测试覆盖三个不同规模和架构的模型:
- GPT-OSS 120B
- DeepSeek R1 670B
- Kimi K2.5 1T
根据 OpenAI 披露的汇总结果,Jalapeño 在三个模型上实现了:
- 峰值吞吐场景下,每瓦 AI 工作量提高约 1.5 至 1.9 倍
- 端到端延迟降低约 1.7 至 3.6 倍
- 高交互工作负载性能提高约 2.1 至 4.1 倍
这里的“每瓦 AI 工作量”,可以理解为消耗相同电力时,系统能够完成多少模型推理任务。
GPT-OSS 120B 测试
在 GPT-OSS 120B 上,官方披露的数据包括:
- 每千瓦峰值吞吐量:约 1.9 倍
- 端到端延迟:约降低 1.7 倍
- 最低 Token 间延迟:约降低 2.7 倍
测试中使用的对比系统为 GB200。
Jalapeño 的标称功耗为 700W,OpenAI 表示,测试期间持续实测功耗没有超过 550W。
DeepSeek R1 670B 测试
在 DeepSeek R1 670B 上:
- 每千瓦峰值吞吐量:约 1.7 倍
- 端到端延迟:约降低 3.6 倍
- 最低 Token 间延迟:约降低 4.1 倍
这一组测试的对比系统为 GB300。
Kimi K2.5 1T 测试
在测试规模最大的 Kimi K2.5 1T 上:
- 每千瓦峰值吞吐量:约 1.5 倍
- 端到端延迟:约降低 3.4 倍
- 最低 Token 间延迟:约降低 3.8 倍
三组数据说明,Jalapeño 的优势并不只存在于 OpenAI 自己的模型上。
不过,这些结果仍然来自 OpenAI 公布的测试,需要注意以下边界:
- 测试只覆盖特定模型和工作负载
- 使用了特定的量化与部署配置
- 功耗对比采用芯片公开标称功率进行归一化
- 不代表所有模型、上下文长度和并发规模都能获得相同提升
- 大规模生产部署后的稳定性仍需继续验证
因此,更准确的结论是:Jalapeño 在公开测试范围内进入了推理延迟和单位功耗吞吐量的帕累托前沿,而不是在所有任务上全面碾压其他芯片。
三、为什么Agent比普通聊天更需要低延迟?
普通聊天通常只需要完成一次模型调用。
Agent 任务却可能连续执行几十次甚至上百次操作:
Understand task
↓
Search files
↓
Call tools
↓
Read results
↓
Modify code
↓
Run tests
↓
Analyze errors
↓
Continue editing
假设单次请求节省 500 毫秒:
Normal Q&A, 1 call
Total saved: about 0.5 s
Coding Agent, 50 consecutive calls
Theoretical cumulative saving: about 25 s
Complex Agent, 200 consecutive calls
Theoretical cumulative saving: about 100 s
实际情况不会如此线性,因为工具执行、网络和排队也会产生延迟,但它说明了一个重要问题:Agent 时代,单次 Token 生成速度只是指标之一,完整任务的累计等待时间更加重要。
这也是 OpenAI 在芯片设计中特别强调交互式工作负载的原因。
更低的端到端延迟可以改善:
- Coding Agent 长任务
- 多 Agent 协作
- 实时语音交互
- 浏览器自动化
- 代码审查
- 高频工具调用
- 长上下文分析
四、OpenAI为什么要自己做芯片?
最直接的原因是成本和供应。
AI 服务的成本不只有模型训练,还包括:
- 推理芯片采购
- 数据中心建设
- 电力和散热
- 高速网络
- 显存与内存
- 模型服务软件
- 空闲和高峰容量
- 请求失败与重试
当 API 调用规模达到足够大的量级后,即使每次请求只节省很小一部分成本,累计结果也可能非常可观。
自研芯片还能让 OpenAI 针对自己的真实工作负载进行联合优化。
例如,通用硬件厂商需要服务大量不同客户,而 OpenAI 可以围绕自己的模型架构、上下文管理、KV Cache 和 Agent 请求模式调整整个系统。
但这并不意味着 OpenAI 准备完全取代英伟达。
OpenAI 官方明确表示,未来仍会广泛部署来自 NVIDIA 及其他合作伙伴的加速器,用于训练和推理。
更合理的判断是:
Frontier training and specific high-performance tasks
Continue using external high-end accelerators
Large-scale, stable, high-frequency inference tasks
Gradually add OpenAI's own chips
Different models and requests
Dynamic scheduling by performance and cost
Jalapeño 提供的是新的自有算力选项,而不是立刻替换所有外部芯片。
五、AI也参与了这颗AI芯片的开发
Jalapeño 还有一个很有意思的细节:AI 不仅运行在芯片上,也参与了芯片的设计和优化。
OpenAI 表示,团队从初始设计推进到 Tapeout,也就是设计定型并交付制造,总共用了约 9 个月。
AI 参与的工作包括:
- 探索不同电路实现
- 缩短测量和验证周期
- 优化算术电路
- 分析性能瓶颈
- 编写和优化模型 Kernel
- 调整工作负载在芯片上的映射方式
在部分 GPT-OSS 注意力与 MoE 模块中,AI 生成的实现比现有人工专家版本快约 1.5 至 1.8 倍。
但是这组数据只适用于选定模块,不代表整个模型都提高了 1.8 倍。
OpenAI 还使用 Codex 和 GPT-Astra,在两个月内把三个原本不在生产计划中的开放模型适配到较高性能。
这意味着未来芯片软件栈的竞争,可能不再完全依赖工程师手写 Kernel,而是进入“AI 帮助 AI 适配硬件”的循环:
AI designs chips
↓
Chips run AI
↓
AI generates and optimizes kernels
↓
Model execution becomes more efficient
↓
New data continues to improve next-generation chip design
六、Jalapeño会让OpenAI API马上降价吗?
目前不能直接得出这个结论。
OpenAI 尚未因为 Jalapeño 公布新的 API 降价计划,也没有宣布用户可以在 API 请求中手动选择这颗芯片。
用户仍然只能选择模型和推理参数,不能这样指定底层硬件:
{
"model": "gpt-5.6-terra",
"chip": "jalapeno"
}
上面的 chip 参数并不存在,仅用于说明。
API 价格最终取决于多个因素:
Chip manufacturing cost
+ Data center cost
+ Power and network
+ Model R&D investment
+ Request volume and utilization
+ Market competition
+ Product pricing strategy
Jalapeño 真正可能带来的,是让 OpenAI 拥有更大的价格和容量调整空间。
短期更可能看到的变化包括:
- 高峰期容量提升
- 响应延迟下降
- Agent 长任务更加稳定
- Fast 模式覆盖更多请求
- 部分模型单位调用成本继续下降
至于这些效率收益会有多少直接反映到 API 价格上,还需要等待正式部署后的产品政策。
七、什么时候投入使用?
OpenAI 计划在 2026 年底前,开始把 Jalapeño 部署到自己的计算基础设施中。
这意味着当前公布的是首批实测成绩,并不代表所有 ChatGPT 和 API 请求已经运行在 Jalapeño 上。
官方同时透露:
- 第一代芯片正在准备规模化部署
- 第二代已经进入深入开发阶段
- 第三代已经开始规划
因此,Jalapeño 并不是一次性实验,而是一条多代自研芯片路线。
八、开发者现在需要修改API代码吗?
不需要。
Jalapeño 属于服务端基础设施升级,API 用户不需要修改请求格式,也不需要更换 SDK。
开发者真正应该做的,是建立自己的延迟和稳定性基线。这样未来底层硬件、模型版本或服务线路发生变化时,能够通过数据判断体验是否真的改善。
下面是一段简单的流式响应测试代码:
import os
import time
from openai import OpenAI
client = OpenAI(
api_key=os.environ["OPENAI_API_KEY"],
base_url="https://genvis.xyz/v1",
)
started_at = time.perf_counter()
first_token_at = None
output = []
stream = client.chat.completions.create(
model="gpt-5.6-terra",
messages=[
{
"role": "user",
"content": "Explain the impact of Prefill and Decode on large model inference latency.",
}
],
stream=True,
)
for chunk in stream:
content = chunk.choices[0].delta.content or ""
if content and first_token_at is None:
first_token_at = time.perf_counter()
output.append(content)
finished_at = time.perf_counter()
if first_token_at is not None:
print(f"First token latency: {first_token_at - started_at:.2f} s")
print(f"Total response time: {finished_at - started_at:.2f} s")
print("".join(output))
测试时不要只运行一次。建议连续测试多组请求,并记录:
- 首 Token 延迟
- 总响应时间
- 输出 Token 数量
- 生成速度
- 请求成功率
- 高峰和非高峰时段差异
- 长上下文与短上下文差异
只有持续测量,才能判断底层基础设施升级是否真正改善了自己的业务。
九、几个常见问题
Jalapeño 是训练芯片还是推理芯片?
它目前定位为 AI 推理芯片,主要用于运行已经训练完成的模型。
用户可以通过 API 指定 Jalapeño 吗?
目前不可以。OpenAI 没有公布让 API 用户选择底层芯片的参数。
它只支持 OpenAI 模型吗?
从公开测试看,它已经运行 GPT-OSS 120B、DeepSeek R1 和 Kimi K2.5,说明其设计并不局限于单一模型家族。
它会取代英伟达 GPU 吗?
短期不会。OpenAI 明确表示将继续广泛部署 NVIDIA 和其他合作伙伴的加速器。
API 价格会下降吗?
Jalapeño 可能降低推理成本,但 OpenAI 目前没有公布与该芯片直接相关的新降价方案。
现在的 API 请求已经使用 Jalapeño 了吗?
不能这样理解。官方计划在 2026 年底前开始部署,目前仍处于生产验证和规模化准备阶段。
写在最后
Jalapeño 最重要的意义,不是 OpenAI 也拥有了一颗 AI 芯片,而是模型竞争正在从单一参数和跑分,扩展到完整的系统竞争。
未来决定 AI 产品体验的,将不只是模型本身:
Model capability
+ Inference chip
+ Memory and network
+ Context management
+ Model routing
+ Agent framework
+ API stability
Jalapeño 在公开测试中表现出了更高的单位功耗吞吐量和更低的端到端延迟。但它仍然需要经过生产验证、规模化部署和更多模型测试。
所以现在最合理的结论不是“OpenAI 马上摆脱英伟达”或者“API 即将大降价”,而是:OpenAI 已经获得了一条可以自主控制推理性能、容量和成本的芯片路线。
当 AI 进入大规模 Agent 调用阶段,这种基础设施控制能力,可能比一次模型跑分领先更重要。
参考资料
- OpenAI:Jalapeño 首批推理性能测试
- OpenAI:完整 AI 基础设施战略
- OpenAI Docs:GPT-5.6 模型说明