节目 从零开始学AI 下一集
第 44 集

OpenAI 首颗自研芯片 Jalapeño:反超英伟达

approximately 8 minutes 入门
音频已上线 点击收听
Mike

欢迎来到从零开始学AI!我是 Mike。Sarah,先考你一个冷知识:日式炸猪排、印度咖喱、鹰嘴豆,再加一根墨西哥辣椒——这四样东西,最近同时出现在了一个高科技机房里。

Sarah

听起来像一份融合菜菜单,不像机房。

Mike

巧了,OpenAI 就是这么起名的。他们机房里装 CPU 的托盘叫 Katsu 炸猪排,装芯片的托盘叫 Vindaloo 咖喱,交换机叫 Chana 鹰嘴豆。而今天新闻的主角——OpenAI 第一颗完全自研的 AI 芯片——就叫 Jalapeño,墨西哥辣椒。

Sarah

给芯片起菜名,工程师的浪漫真是朴实无华。不过等等,你说自研?OpenAI 不是一直买英伟达的卡吗?

Mike

对,这就是今天的重点。就在刚刚,这颗辣椒交出了第一份第三方实测成绩单,测试方是很有名的半导体分析机构 SemiAnalysis。结论一句话:在 AI 推理这件事上,它把英伟达最强的 GB200、GB300 全部比了下去。

Sarah

推理这个词咱们节目里出现过好几次,今天干脆把它讲透。AI 的推理,到底是在推什么?

Mike

你可以把大模型想象成一个超级填词高手。你说"今天天气真",它接一个"好"字。每接一次字,就是一次推理。而 AI 吐出来的每个小碎片,术语叫 token。

Sarah

所以"AI 回答快不快",本质上就是芯片每秒能吐多少个 token?

Mike

完全正确,而这正是芯片的主场。实测里有个很直观的数字:跑一个叫 GPT-OSS 120B 的模型,Jalapeño 每秒吐 1459 个 token,英伟达 GB200 只有 535 个,连一半都不到。换算一下,两个 token 之间只隔 0.69 毫秒。人正常朗读一秒大概五六个字,它一秒甩出一千多个,眼睛根本跟不上。

Sarah

这个对比有画面了。不过只看每秒吐字数,是不是有点像只看百米冲刺?用户其实更关心整段回答什么时候说完吧。

Mike

问到关键了,这叫端到端延迟。同一个任务,Jalapeño 跑完只要 1.65 秒,GB300 要将近 6 秒,差了 3.6 倍。平时聊天,4 秒你可能忍忍就过去了。但现在是 AI agent 的时代——程序要连续执行几十个步骤,订机票、填表格、查资料,每一步慢一点,最后乘起来就是灾难。

Sarah

就像排队结账,前面每个人多磨蹭 4 秒,一整条队伍就崩了。

Mike

这个比喻很到位。网上还流传一个更夸张的数字:104.3 倍。听着吓人,我给你解释清楚。工程师故意把 GB300 推到它自己的最快解码速度——每秒 169 个 token——然后看在这个出字速度下谁还能扛住更多请求。结果在这个点上,Jalapeño 的吞吐量是它的 104.3 倍。换句话说,对手跑到气喘吁吁的地方,正是辣椒还在匀速巡航的地方。

Sarah

明白了,不是全程都快 100 倍,而是在高速档位这个区间里差距被拉到极致。

Mike

对,按双方各自最优工作点算,三个模型上的优势是 1.5 到 1.9 倍;但在高交互场景——真人实时等着回话那种——能拉开到 2.1 到 4.1 倍。别忘了功耗:Jalapeño 标称 700 瓦,GB300 是 1400 瓦,一半的电干双倍的活。把供电散热全摊进去,每小时成本约 1.56 美元,跟老将 H100 基本持平,而最新的 Vera Rubin 要 3.61 美元。

Sarah

一半电费双倍产出还更便宜,财务看到这个数字眼睛都会亮。那这是辣椒的全部实力吗?

Mike

还没有。这次测试连投机解码都没开。这个词正好今天讲掉:大模型生成下一个字之前,先用一个小而快的模型猜几个可能的答案,再让大模型一次性验算。猜对了就白赚好几步,猜错了重来,反正验算比生成便宜得多。就像考试先扫一眼选项蒙个大概,再用排除法快速确认,比老老实实逐题推导快多了。SemiAnalysis 估算,光这一招就能把每 token 成本再砍掉 2/3 以上。

Sarah

所以这份成绩单还是闭着眼打出来的。那问题来了——OpenAI 第一次做芯片,凭什么一步到位?

Mike

两个原因。第一是速度:从设计到流片只用九个月,行业常规是 18 到 36 个月。第二才是杀手锏:他们在设计室里放了一台外挂——自家最强模型 GPT-Astra,也就是外面传闻很久的 GPT-6。它帮团队探索方案,把设计、测量、验证这个循环拼命压缩,还顺手微调算术电路:SIMD 单元面积省 8%,矩阵引擎省 10%,时序和功耗反而更好。

Sarah

等一下,我捋一捋。AI 帮忙设计了芯片,这颗芯片专门用来跑 AI,跑起来的 AI 又能去设计下一代芯片……

Mike

对,这个圈转起来了,行话叫飞轮:起步推着费劲,越转越快,最后停不下来。还有个细节能看出这颗芯片有多极端:主计算晶片约 840 平方毫米,光刻机能画的最大面积是 858 平方毫米,只留 18 平方毫米边角,基本贴着物理天花板画的。

Sarah

这已经不是挤牙膏了,是把牙膏皮剪开刮干净的程度。

Mike

哈哈,这个形容精准。那英伟达那边呢?很多人第一反应是:CUDA 护城河不是号称最深吗?

Sarah

正好,CUDA 这个词我每次听到都觉得玄乎,今天必须讲明白。它到底是什么?

Mike

一句话:CUDA 是英伟达将近 20 年攒下来的一整套软件工具和使用习惯,全世界工程师都在上面写过代码。想换成别家芯片?对不起,代码基本要重写。这就相当于城堡周围那条又深又宽的河——硬件未必不可替代,但这条河让你懒得游过去,所以叫护城河。

Sarah

那 SemiAnalysis 怎么就说这条河可能干了呢?

Mike

理由有点扎心:英伟达硬件本身并不弱,最新的 Rubin 其实比 Jalapeño 还早一个月完成流片。真正输掉的是软件追上来的速度——OpenAI 从零开始写自己的软件栈,几个月就把生态补齐了。而且从零开始反而占便宜:没有历史包袱,架构可以按白纸随便画。

Sarah

所以不是英伟达变弱了,是对手起跑的方式不一样了。

Mike

还有一层更微妙的讽刺。帮着设计这颗辣椒的 GPT-Astra,干活时靠的算力是什么?很大一部分就是英伟达的 GPU。英伟达的机器,亲手参与培养了要跟自己抢生意的对手。

Sarah

相当于师傅带出了踢馆的徒弟,学费还是师傅出的。

Mike

局面上英伟达当然还坐在王座上,一颗芯片掀不了桌子。但 OpenAI 的路线图已经排开了:去年 10 月跟博通签了 10 吉瓦定制芯片大单,差不多十座核电站满发的规模;Jalapeño 只是第一代,第二代在深度开发,第三代正在成形,量产 2027 年爬坡。顺便说一句,内部也不是没风波——掌管数据中心的 Chris Malone,就是负责星际之门超算的那位,今天被曝离职了。

Sarah

IPO 在即,这个节骨眼上走掉基础设施统帅,确实让人多想。不过 Mike,我脑子里挥之不去的画面比这些大戏安静多了:某个实验室里,一颗以佐餐辣椒命名的芯片,躺在名叫咖喱的托盘里,安静地击败了地球上最值钱的芯片公司。

Mike

而且挑战者没有在大门口排队,它已经在机房里面了,风扇正转着呢。今天的从零开始学AI就到这里。如果你也觉得这颗辣椒够劲,欢迎转发给朋友,我们下期再见!

Sarah

下期见!

已复制