OpenAI跟博通合作搞的推理芯片Jalapeño,在Hot Chips大会上晒出了跑分。每瓦吞吐量是英伟达Blackwell的1.5到1.9倍,低延迟下生成速度更是达到GB300的4.9倍。这款专门为推理场景设计的芯片,正在悄悄改写AI算力的游戏规则。
Jalapeño一出,英伟达有点慌
在Hot Chips大会上,OpenAI和博通联合研发的推理芯片Jalapeño首次公开跑分。用SemiAnalysis的InferenceX工具实测,在GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T这三款大模型上,Jalapeño每瓦吞吐量达到英伟达Blackwell系统的1.5到1.9倍。低延迟场景更夸张:跑DeepSeek R1时,单个用户生成速度大约700 token/s,而英伟达GB300只有169 token/s,前者是后者的4.9倍。注意,这还只是A0版芯片的成绩。
为什么能这么快?
Jalapeño的架构跟通用GPU完全不是一路。它用单一架构同时处理prefill和decode,把计算核心和HBM4内存切片一一对应,数据传输的延迟和功耗大幅降低。说白了,模型权重就放在计算单元旁边,不需要大老远从显存里来回搬运。
设计速度也相当惊人。从初始设计到流片只用了9个月,A0版负责跑分,改进的B0版已经在台积电N3P工艺上量产,第二代芯片也在研发中。OpenAI还透露,芯片设计、驱动开发和模型移植都用上了自家AI工具,比如Codex和GPT-Astra,差不多两个月就把DeepSeek R1和Kimi K2.5优化好了。
AI辅助设计带来的最大好处就是迭代快。传统芯片开发动辄两三年,Jalapeño九个月就能流片,未来模型和硬件的协同优化只会越来越紧密。
跑分好看,但别高兴太早
不过话说回来,这次跑分是OpenAI自己提供给SemiAnalysis现场见证的,测试场景只覆盖了约8k输入、1k输出的单轮推理,长上下文和多轮智能体任务都没测。所以Jalapeño的真实实力还得看后续的完整benchmark。但单从数据看,专用推理芯片的潜力已经摆在那儿了。
三种路线,谁主沉浮?
有意思的是,英伟达在同一天宣布Vera Rubin平台投产,苹果也发布了2nm芯片M6。三家公司各走各的路:英伟达继续做通用GPU,苹果押注端侧制程,OpenAI专攻模型专用芯片。对企业用户来说,算力选择变多了,但也更让人眼花缭乱。
企业上云,怎么选算力?
对大多数中小企业来说,自研芯片不现实,最终还是得靠云服务商。比如阿里云这类头部平台,提供了云服务器ECS和各种GPU实例,找阿里云代理商还能拿到额外折扣,再叠加阿里云优惠和阿里云代金券,企业上云成本能压得更低。另外,易枫顺 - 阿里云官方旗舰级代理商可以提供专属服务。如果将来Jalapeño通过云服务商开放,那应用门槛会大大降低。
AI模型越来越强,推理成本却在快速下降。Jalapeño这类芯片一旦规模化部署,每瓦性能提升意味着同样的电费能支撑更多客户请求。企业上云时多留意云厂商的硬件更新,别光盯着价格,性能功耗比同样关键。
FAQ
Q: Jalapeño芯片什么时候能用上?
A: 目前A0版已经跑完分,B0版正在台积电N3P工艺上量产,第二代也在开发中。预计明年可能通过云服务或特定客户开放,官方还没公布具体时间。
Q: Jalapeño比英伟达强多少?
A: 每瓦吞吐量是Blackwell的1.5-1.9倍,低延迟下生成速度约4.9倍。不过测试场景有限,长上下文和多轮任务的表现还不清楚。
Q: 我的公司需要关注这类芯片吗?
A: 如果是重度AI应用,推理成本是主要开销,Jalapeño这类专用芯片有望大幅降低单位成本。建议持续关注云厂商的适配方案,比如阿里云的ECS更新。
关于易枫顺
深圳市易枫顺网络科技有限公司是阿里云官方旗舰级代理商。提供云服务器ECS、云数据库RDS、对象存储OSS等阿里云全系产品官方特惠折扣与代金券申请,以及多云成本优化、企业上云一站式服务。客服热线:19520841949 - 易枫顺
来源:极客公园