节目 从零开始学AI 下一集
第 45 集

GLM-5.3 Flash:同等智能,1/40 的价格

approximately 8 minutes 入门
音频已上线 点击收听
Mike

欢迎来到从零开始学AI!我是 Mike。Sarah,先给你出道脑筋急转弯——什么东西能便宜 40 倍,脑子却一样好?

Sarah

打折季的包包?还是共享充电宝?

Mike

比那更狠。今天的主角是智谱刚发布并开源的 GLM-5.3 Flash,它的规格写作 320B-A18B,320B 总参数,每次只激活 18B,却挤进了全球前沿那一档。

Sarah

等一下,320B-A18B 这个写法我一直没懂。B 是 Billion,十亿,那 A 是什么?

Mike

好,先把这个概念讲透。你可以把大模型想象成一座巨型图书馆,藏书 320B 本。但每次回答问题,管理员只会推开其中 18B 本相关的书架来查资料,剩下的暂时不亮灯。

Sarah

所以总藏书很大,但每次干活只开一小片区域,省电又省时间?

Mike

完全正确。学术上这叫 MoE,混合专家。GLM-5.3 Flash 就是靠这个思路,把能力做上去、把成本压下来。

Sarah

能力怎么证明?不会是自己说的吧?

Mike

看第三方。全球很权威的 Artificial Analysis Intelligence Index,也就是 AA 综合智能指数,它拿到 57 分。

Sarah

57 分算什么水平?

Mike

和 Anthropic 最受欢迎的 Claude Opus 4.8 同分。在智谱自家的 Z.ai Code Bench 体感测试里,编程表现也和 Opus 4.8 相当。也就是说,脑子在同一个段位。

Sarah

脑子同段位,那价格呢?你刚才说的 40 倍怎么来的?

Mike

官方定价:是完整版 GLM-5.3 的 1/10,限时折扣内是 1/20,和 Opus 4.8 比是 1/40。口号就一句:同样智力,1/40 价格,前沿智能第一次不用省着用。

Sarah

同样 57 分,价格 1/40……这已经不是性价比,是把定价表撕了重写。

Mike

而且他们为了证明不是自卖自夸,发布前玩了一招盲测。把模型匿名成 Ox-Alpha,中文社区叫它牛来,放到 OpenCode 和 OpenRouter 上让大家随便用。

Sarah

匿名?就是不告诉大家这是谁家的模型?

Mike

对,无名字无介绍。结果牛来迅速成了当周最受欢迎的模型,双平台调用量都破了纪录。流量有多大?全部由国产芯片扛住的,后面我们再细说。

Sarah

等等先别跳。同样聪明的脑子,怎么做得这么便宜?肯定动了架构吧?

Mike

动了大手术。总参数和上一代 GLM-4.5 差不多,320B 对 355B,几乎没变。但激活参数从 32B 砍到 18B,层数从 92 层减到 45 层,几乎减半。配上全新的 30T Token 多模态预训练数据,以更少的计算实现了更强的效果。

Sarah

层数减半我能理解,像把 92 层大楼压缩成 45 层,但每层更高更能干。可 1M 长上下文不是一直很费钱吗?怎么省的?

Mike

问到核心了。他们做了业界首个稀疏注意力加线性注意力的混合架构。打个比方,线性注意力像用便签记最近几页的重点,递归往下翻很便宜;稀疏注意力像带一个很聪明的索引器,帮你从整本书里把远处相关的那几行拽回来。

Sarah

一个管近处,一个管远处,分工省钱。

Mike

还有个小机关叫 IndexPool。原本索引器要存 4 个缓存向量,它用加权池化压成 1 个,1M 上下文下的延迟和内存直接砍一刀。

Sarah

效果能量化吗?

Mike

能。和完整版 GLM-5.3 比,注意力计算量降了 3.01 倍,KV 缓存大小降了 4.44 倍。每层平均下来,在他们对比的几家里,包括 DeepSeek-V4-Flash 和 Kimi-K3,GLM-5.3 Flash 的单 Token 计算量是最低的。

Sarah

那短板呢?总不能全是优点。

Mike

团队自己也说了,KV 缓存大小仍然略高于 Kimi-K3 和 DeepSeek-V4-Flash,这是下一轮要继续优化的方向。

Sarah

坦诚加分。对了,你刚才说这是 GLM-5 系列首个原生多模态,什么叫原生多模态?会看图不就叫多模态吗?

Mike

重点在原生和用途。他们提出的概念叫视觉编码,不只是看图答题,而是把看的能力嵌进编程里。做前端、游戏、3D 仿真时,最终要交付的是人能看见的界面和世界,所以模型要会自己看、自己改。

Sarah

以前是写完代码跑一下,看报错就改。现在是跑起来看画面,觉得不好看也改?

Mike

对,他们专门搭了一条数据合成流水线,训练模型自己判断何时该看,并用视觉反馈指导下一步。还结合了基于真实用户操作的强化学习,连交互体验好不好都学会了评判。

Sarah

有没有具体成果?别光讲原理。

Mike

有个很震撼的例子:没有任何外部素材,GLM-5.3 Flash 在 Blender 里自主跑了 16 个小时,搭出一套约 400 平方米的专业主厨自宅和测试厨房,几何、材质、光照、空间全部一致,从任何角度看都不穿帮。

Sarah

400 平方米,16 小时手搓一套房?这已经不是写代码,是包工头了。

Mike

在 ZCode 里,它还能把代码、浏览器和图形界面打通,Browser Use Agent 和 Computer Use Agent 协同,很多问题只有渲染出来点一点才暴露。

Sarah

听起来很极客,但对普通打工人有什么用?我只想要一份不丑的 PPT。

Mike

正好,这也是它发力的地方。靠视觉理解,它能把自己生成的 PPTX、PDF、DOCX、XLSX 和预期效果对比,自我检查和美化。还专门为金融和法律做了优化。

Sarah

金融怎么优化?我每周都要看研报。

Mike

金融上能跑全流程:从带来源的研究、到报告生成、再到建模分析,每一步都可追溯。法律上能审合同里的费用、账户和责任条款,按律师习惯批注留痕,还能直接起草函件和诉讼文书,格式就是可交付的。

Sarah

可直接交付这四个字,对加班的人就是救命稻草。

Mike

最让我意外的其实是最后一部分——跑在哪。你猜牛来破纪录那一周,流量跑在什么机器上?

Sarah

不会是国产芯片吧?你刚才埋了个伏笔。

Mike

就是国产芯片集群,用自研高速网络连起来。单张芯片算力和内存相对有限,扛 1M 上下文很吃力,所以他们基于 SGLang 造了专用推理引擎。

Sarah

专用引擎谁造的?不会又是 AI 自己吧?

Mike

被你猜中了。很大一部分是 GLM-5.3 驱动的 infra agent 帮工程师一起造的,帮忙写算子、找瓶颈、改服务栈。模型优化系统,系统承载模型,转起来了。

Sarah

自己给自己造跑道,有点科幻。

Mike

技术栈也很激进:线性注意力和 LM head 的节点内张量并行、ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合缓存、Layer Split。集群层面用 Encode-Prefill-Decode 分离架构,把编码、预填充和解码拆成独立可扩缩的工作池。

Sarah

说人话,管用吗?

Mike

和同一硬件上的初始基线比,端到端性能提升了 3 倍。单 Token 成本已经和主流英伟达 GPU 相当。也就是说,国产芯片在大规模场景下,真的把前沿模型经济地跑起来了。

Sarah

所以故事变了,不再是谁有最贵的卡,而是谁能把手里的卡用得最聪明。

Mike

而且已经开放了。API 在 BigModel 和 Z.ai 上都能调,chat.z.ai 和智谱清言 App 能直接体验,ZCode、AutoClaw 也都接上了。GLM Coding Plan 还每天限量发 10,000 张体验卡。

Sarah

我印象最深的其实不是 1/40,也不是 57 分。是那间 400 平方米的房子。一个会盯着自己作品说这光不对、这材质假,然后默默改好的模型,第一次让我觉得 AI 有点像手艺人。

Mike

还有那头牛。几周前成千上万人爱上了一个匿名名字,牛来。他们不知道,自己已经在用更便宜的未来了。

Sarah

同样的脑子,更小的账单,再加一头骗过所有人的牛。下期从零开始学AI,我们再一起拆下一个 AI 故事,再见!

Mike

再见!记得去试试 GLM-5.3 Flash,它的 Blog 就在 z.ai/blog/glm-5.3-flash,见见那间它自己盖的房子。

已复制