节目 从零开始学AI 下一集
第 43 集

小米玄戒三连发:手机、汽车、家各一颗AI芯片

approximately 8 minutes 入门
音频已上线 点击收听
Mike

欢迎来到从零开始学AI!我是 Mike。Sarah,今天聊一个听起来很硬核、其实特别日常的东西——芯片。先问你一个问题:你觉得手机里那个负责思考的"大脑",长什么样?

Sarah

大概是一块绿色小板子,上面焊着黑色小方块?

Mike

差不多!那个黑色小方块就是芯片。今天我们借一条新闻把它讲透。小米发布了新一代玄戒芯片,一共三颗:玄戒O3,装在最高端手机里的 AI 旗舰 SoC;玄戒O100,专门给大模型加速的芯片;玄戒D100,给智能驾驶用的芯片。

Sarah

等等,信息量有点大。SoC 是什么?听着像某种社交软件。

Mike

好问题。你可以把手机想象成一座城市:CPU 是市政府,什么都管;GPU 是建筑队,擅长同时干大量重复的活儿,比如画出屏幕上的每个像素。SoC 就是把这些部门全部装进同一栋楼里办公,省时间也省电。

Sarah

明白了,一栋楼里塞下整个市政府。那新闻里反复说的晶体管呢?

Mike

晶体管就是芯片里最小最小的开关,跟家里的电灯开关一个原理,只不过它只有几个原子那么宽。开代表 1,关代表 0,所有照片、语音、游戏,最后全变成无数个开关的开开关关。

Sarah

所以芯片越聪明,本质上是开关越多、越小?

Mike

完全正确。玄戒O3 在 133 平方毫米——差不多指甲盖那么大——塞进了 240 亿个晶体管,比上一代还多 26%。顺便说一句,3nm 这种数字指的是工艺等级,数字越小,单个开关就能做得越小。

Sarah

240 亿个开关挤在一个指甲盖上……那性能得什么水平?

Mike

安兔兔跑分 522 万。但更值得说的是省电这件事:它的图形模块性能几乎翻倍,功耗反而比上一代降低了 64%。要知道芯片行业正常节奏,一代升级也就提升 20% 到 30%,这个属于跨级发挥。

Sarah

为什么手机芯片突然这么拼命卷 AI?

Mike

因为 AI 正在从云端搬到手机上,行话叫"端侧"。打个比方:以前你问 AI 一个问题,像打电话叫外卖,问题送到远方的厨房做好再送回来;端侧 AI 是自己家里开火,没网也能做饭。想让大模型在你手机上开火,就得有专门的灶台——这就是 NPU。

Sarah

NPU 我一直没搞懂,跟 CPU 有什么区别?

Mike

CPU 是全科学生,语数外体都能教,但都不算顶尖;NPU 是请来的专科数学老师,只会一种功夫——大规模矩阵运算,也就是 AI 最爱吃的那道菜。玄戒O3 的 NPU 能输出 200 TOPS 算力,而且是为大语言模型量身定制的。

Sarah

可是大模型那么大,怎么塞进手机?我听说都是几百 GB 的家伙。

Mike

靠量化。你可以把模型想成一只塞满衣服的行李箱:参数本来都是高精度数字,很占地方;量化就是把每件衣服叠得更紧——用更简单的数字代替原来的数字,箱子瞬间小一半以上。

Sarah

叠太紧衣服会皱吧?模型会不会变笨?

Mike

问到点子上了。传统做法叫 INT4 量化,压得狠但确实有损耗。小米这次是芯片团队和模型团队坐在一起联合设计了一种 5 值方案,配合硬件压缩,最后效果:回答出第一个字快 40%,整体推理快 45%,功耗还降了 26%,效果跟原来基本持平。

Sarah

连"出第一个字的速度"都单独优化,这确实是抠体验抠到骨头了。

Mike

还有更细的。CPU 读内存有个等待时间,他们把玄戒O3 压到了 82 纳秒。以前不同模块之间传数据要先转换协议,像中译英、英译德、德译俄;现在统一成一套协议,大家都说普通话。还给两个关键部件修了一条专属高架桥,光这一项就省出 15 纳秒。

Sarah

82 纳秒……这个单位普通人真的没感觉。

Mike

单次确实没感觉,但你想想,手机每秒要做几十亿次这样的访问,每次快一点,加起来就是你刷视频更顺滑、电池更耐用。芯片行业的进步就是这样一纳秒一纳秒攒出来的。

Sarah

手机讲完了,那颗 O100 是干嘛的?名字听着像个考试分数。

Mike

它解决的是业内著名的"内存墙"。我先讲个厨房的故事:处理器是厨师,内存是冰箱。传统结构里厨师在客厅炒菜,冰箱放在阳台上,每切一道菜都要跑去阳台拿食材,来回全是浪费。模型越大,这道墙撞得越疼。

Sarah

那解决方案很明显啊——把冰箱搬进厨房!

Mike

他们做得更彻底:直接把内存晶圆一层层堆在计算晶圆下面,盖成一座楼,食材从楼上垂直递下来。这叫晶圆级 3D 堆叠,玄戒O100 是全球第一颗用 6nm 工艺做到这件事的 AI 芯片。带宽达到每秒 1.22TB,是目前旗舰手机的 16 倍。

Sarah

16 倍是什么概念?

Mike

概念就是:配上玄戒O3 之后,端侧跑大模型能到每秒生成 330 个 token。token 你可以理解成 AI 吐字的最小单位。330 个 token 一秒,基本是你话音刚落,答案已经出来了。

Sarah

第三颗 D100 呢?总不能车也开火做饭吧。

Mike

它管的是开车。D100 是国内首款 3nm 高算力智驾芯片,20 核 CPU 配 16 核 NPU,最大支持 160GB 统一内存,能在车上直接部署 2000 亿参数的大模型。明年正式商用,这次先装进了一台桌面原型机展示,叫小米AI Cube,外壳上开了 33874 个蜂窝散热孔。

Sarah

33874 个……精确到让人心疼,肯定有工程师一个一个数过。

Mike

这就是工程师的浪漫。最后我们把三颗芯片放回一张图上看:O3 在你的口袋里,D100 在你的座舱里,O100 负责把最大的大脑喂饱,家里还有音箱和电视排队等着。以前这些设备各有各的脑子,现在小米想让它们共用同一套算力底座。

Sarah

所以小米真正下的注不是某一台手机,而是让 AI 无处不在——而芯片就是这套雄心的地基。

Mike

没错。模型可以一代代换,应用可以一个个改,但底下这几片指甲盖大小的硅,决定了整个生态的天花板有多高。

Sarah

听完我都想拆开手机看看里面这座"城市"了。今天的从零开始学AI就到这里,如果你对芯片还有什么好奇的问题,欢迎留言告诉我们,下期再见!

Mike

下期见!

已复制