节目 从零开始学AI 下一集
第 56 集

DeepSeek V4.1 Flash:更强更快更普惠

2026-09-11 approximately 9 minutes 入门
音频已上线 点击收听
Mike

欢迎来到从零开始学AI!

Mike

Sarah,今天这条新闻有点反常识,系列里最小的模型,先发布了,结果还把一众旗舰都超了。

Sarah

你说的是 DeepSeek V4.1 Flash 吧?我第一眼也愣了,最小尺寸,居然直接对标旗舰水平?

Mike

对,官方说得很清楚,这是全新模型结构系列中的最小尺寸,还自带原生多模态视觉理解能力。

Sarah

先帮零基础听众铺个概念吧,什么叫原生多模态视觉?是不是就是能看图?

Mike

就是这个意思。不用外挂别的工具,它自己就能看懂图片,再跟文字一起理解,一步到位。

Sarah

好,第二个概念,552B 的 MoE 模型。这数字听着吓人,怎么讲才不晕?

Mike

你可以把它想成一个超大公司,总共有 552B 的员工,但每次干活只叫一小拨人出来。

Sarah

哦,MoE 就是专家混合,平时大家轮休,谁对口谁上,这样工资成本就低了?

Mike

太对了。这次更狠,还用了全新的 Causal-Encoder-Decoder 结构,输入和输出不对称。

Sarah

不对称是什么意思?输入和输出还不一样大?

Mike

对,输入激活只有 8B,输出激活 16B。就像阅读理解看得飞快,写答案时再认真发力。

Sarah

这个比喻好,眼睛扫得快,落笔才用力。所以成本比同尺寸模型低很多,道理就在这?

Mike

没错,花小钱办大事。而且它还用了新的预训练方式,加更大规模的强化学习后训练。

Sarah

强化学习我熟,就是不断试错、被打分,最后越练越聪明。那成绩单呢?

Mike

在 Agentic Benchmark 上,超过了包括 DeepSeek V4 Pro 在内的一众旗舰模型。

Sarah

等等,Agentic Benchmark 是考什么的?和平时那种问答考试不一样吧?

Mike

不一样,它考的是当 Agent 干活的能力,能不能拆任务、调工具、跑完一整条链路。

Sarah

懂了,不是考背书,是考独立出差。能订票、能报销、能收尾的那种。

Mike

就是这个感觉。所以官方才敢说,能力上限更高,推理速度更快,吞吐更大,还能扩展到更大参数模型。

Sarah

小个头先探路,大个头还在后面。这个系列化发布,听着像先派先锋探探路?

Mike

很像。最小的先验证新结构跑得通,后面直接放大。而且还有个省钱大招,KV Cache 被大幅压缩了。

Sarah

KV Cache 又是什么?每次听到缓存我就头大。

Mike

你把它想成草稿纸。模型聊天时,要把前文记在草稿纸上,不然转头就忘。

Sarah

Agent 任务特别长,草稿纸岂不是越堆越厚?费用就是这么烧掉的?

Mike

对,尤其缓存命中的费用占比很高。这次和上一代比,对 HBM 的需求减到 1/4,对 SSD 的需求减到 1/8。

Sarah

HBM 和 SSD,一个是桌面上的便签,一个是抽屉里的档案箱,对吧?

Mike

很准。便签贵但拿得快,档案箱便宜但慢,两个都省了,Agent 跑长任务就便宜多了。

Sarah

还有个数字更夸张,相对初代模型,KV Cache 已经缩小了 437 倍?

Mike

对,437 倍。你可以理解成,以前要一整面墙贴草稿,现在一张小卡片就记下了。

Sarah

那 API 侧呢?开发者怎么用上?

Mike

已经同步上线 DeepSeek API,原生支持多模态,把模型名称改成 deepseek-flash 就能调用最新的 V4.1 Flash。

Sarah

老用户呢?原来用的 V4 Flash 和 V4 Flash Vision Exp 怎么办?

Mike

那两个旧版本已经下线,出于兼容考虑,deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 会暂时路由到 V4.1 Flash。

Sarah

路由就是自动转接吧?打旧电话,自动转到新前台,体验不断档。

Mike

对。还有个更重要的,V4.1 Flash 在性能、费用、速度、总用时上全面超越 V4 Pro,所以 V4 Pro 要有序下线了。

Sarah

时间点记一下,北京时间 9 月 14 日 12:00 之后,到未来 V4.1 Pro 上线之前,访问 deepseek-v4-pro 的请求会全部路由到 V4.1 Flash。

Mike

而且按 V4.1 Flash 单价计费。相当于花旗舰的旧入口,进来坐的是又快又便宜的新车,还按新车票价收钱。

Sarah

腾讯的 WorkBuddy、CodeBuddy 和 OpenCode 作为官方合作伙伴,已经全量接入了,开发者可以直接去用。

Mike

定价这块也调了。得益于架构创新,成本下来了,定价跟着下调,还是峰谷定价。

Sarah

峰谷定价是不是跟电费一样?半夜用电便宜,鼓励大家错峰?

Mike

一模一样。闲时价格是高峰时段的一半,鼓励大家按实际使用情况调整任务时间,新价格 9 月 10 日 12:00 开始生效。

Sarah

整理任务的同学可以把批量跑批的活挪到闲时,账单直接打对折,这很实在。

Mike

最后是开源。模型已经放到 HuggingFace 上,论文也一起公开了,全力支持社区做推理适配。

Sarah

地址我念一下吧,huggingface.co 上搜 deepseek-ai 的 DeepSeek-V4.1-Flash,论文也在同一页。

Mike

如果有大规模部署需求,还得有点家底,官方说要 2k 卡 GPU 加存储集群,可以直接联系他们。

Sarah

2k 卡,那是真大户了,普通公司看看就好,重点还是 API 直接用。

Mike

回头看,这次的逻辑特别顺。结构不对称省算力,缓存压缩省内存,峰谷定价省账单,三笔省到一块去了。

Sarah

而且最小的先来,把路铺平。等 V4.1 Pro 上线,估计就是这个新结构的完全体了。

Mike

最有意思的是,以前大家比谁更大,现在是最小的跳出来说,我更快、更强、还更便宜。

Sarah

以后选模型,别先问多大,得先问问,它那张草稿纸是不是已经换成小卡片了。

Mike

哈哈,这个检验标准好。下期 V4.1 Pro 来了,我们再来拆大的那一个,我们下期见!

Sarah

下期见!

已复制