节目 从零开始学AI 下一集
第 63 集

小米MiMo-V2.6直播训模型:手把手看懂仪表盘

2026-09-17 approximately 11 minutes 入门
音频已上线 点击收听
Mike

欢迎来到从零开始学AI!先问你一句,一小时烧掉3万美元,还敢开直播让人围观,你觉得这是自信还是疯了?

Sarah

小米干了。沉寂了快半年,罗福莉出来官宣,这半年就研究了一件事,强化学习到底能扩展到多远。新模型MiMo-V2.6带了两个版本,Flash和Pro,训练过程直接现场直播。

Mike

直播间里能看到什么?花了多少钱、跑了多少步、奖励曲线涨没涨,连哪块显卡出故障,全公开。点进去一看,一眨眼10美刀,一分钟4000多人民币。见过开放权重、开放代码的,开放训练过程的,真是头一回。

Sarah

先讲概念,什么是强化学习?一句话,让AI在试错中学会拿高分。打个比方,就像训小狗,坐下就给肉干,乱叫就没得吃,几轮下来,它就知道该怎么做了。

Mike

模型也一样。同一道题不只答一次,让它试16种不同的解法,再告诉它哪种好。小米这次一个训练Step要处理20多亿Token,1568道题,每道16种尝试,一轮就是2万多条试错记录。

Sarah

题量乘以尝试次数,再乘以每条轨迹的长度,就是账单的形状。智能体的一条轨迹不是一问一答,可能包含几十轮思考、工具调用和环境反馈,所以单步能堆到20多亿Token。你记住1568乘以16,半张仪表盘的数字就都有了分母。

Mike

关键来了,试错也得讲规模。小米这次沿三个方向加码,第一个就是算量,直接拉满。第二个是环境,让模型同时在代码、通用、网络安全、视觉、对话五类考场里考,工具和规则各不相同。

Sarah

五类考场同时开考?那模型不会串台吗?

Mike

问得好,这恰恰是目的。只刷一种题,模型容易变成偏科生。五张卷子混着考,逼着它长出通用本事。考场就是沙箱,同时开着几千个,官方叫飞行沙箱数,仪表盘上能实时看到开了多少间。

Sarah

还有个工程细节,整个训练是完全异步的。有的智能体还在做题,有的已经在打分,有的在更新模型,不再排队等。就像后厨同时炒十个菜,谁先熟谁先上。

Mike

第三个方向最有意思,给打分本身加算力。代码题还能跑测试用例,可开放任务怎么打分?直播页里举了个例子,一个任务要连做40步,搜资料、写代码、改bug,最后成了。你只说一句干得不错,模型根本不知道前40步里哪步最关键。

Sarah

所以小米搞了个组内信用分配,同一道题的16种尝试放一起比,细看哪几步真正扭转了局面。等于从只看期末成绩,变成每道大题都给步骤分。

Mike

有位围观的大佬翻译得很直接,三个方向,说白了背后都是算力。预训练卷完数据和参数,现在开始卷试错本身了。

Sarah

概念齐了,咱们打开直播页,从上往下走一遍。最顶上的导航栏只有两样东西,两个任务的合计账单,外加北京、洛杉矶、纽约、伦敦四个时钟。顶栏回答两个问题,烧了多少钱,现在几点。

Mike

账单是按秒跳的。9月17日上午那会儿,Pro每秒5.71美元,Flash每秒2.86美元,合计一小时约3万美元,总账单约116万美元。右边还有总览、指标、说明三个标签,加一个明暗主题开关。

Sarah

往下最先看到的是公告栏,有公告才出现,最新排最前面。当前有两条,一条说Pro因为单个节点的显存问题正在重启,另一条说刚更新了双方的离线评测分数。

Mike

看仪表盘的老手都是先看公告再看数。不看这栏,你会把一次显存故障误读成模型学崩了。公告告诉你数字背后的事,曲线断了是因为重启,分数变了是因为刚判完卷。

Sarah

接下来是训练状态行,从左到右四组信息,名字加进行中标记、超大字号的当前步数、累计耗时加开始时间、阶段进度条。快照里Pro跑到第12步,Flash跑到第17步,Flash起跑晚但步子快。

Mike

阶段条最值得看。处在生成轨迹阶段,表示模型正在环境里干活产出尝试。处在训练阶段,表示正在拿尝试更新模型。你可以理解成先让学生做卷子再讲卷子,阶段条告诉你现在是做卷子时间还是讲卷子时间。

Sarah

状态条下面跟着六个格子,全页信息密度最高的地方。左起是平均通过率,同一道题试16次、通过的占比再平均,后面跟着相对第1步的变化箭头。快照里Pro约0.609,Flash约0.586,箭头都向上,就是变强了。

Mike

接着是当前已花费,数字按秒往上跳。然后是本步Token数和累计Token数,快照里Pro本步约23.3亿、累计约250亿,Flash本步约27.4亿、累计约405亿。再往后是累计训练样本数,Pro约30万,Flash约42.6万。压轴的是训练批量规格,1568个提示词乘以16条轨迹。

Sarah

再往下是离线评测区,当前只有一块记分牌,DeepSWE编程智能体测试,平均测3次。分数是Flash第12步60.77分,从第1步48.67分涨上来。Pro第8步62.24分,接口里还冒出过第10步63.72分。

Mike

离线评分总比训练步数慢半拍,判卷子本来就需要时间。看这个榜要看斜率不要看名次,Flash从更低起点快速追近,Pro保持小幅领先,训练才一天多,现在看的是涨势。

Sarah

接下来是18张置顶图表的大方阵,分成四组。奖励与通过率组打头,平均通过率和平均奖励是双胞胎,一个看16次尝试里通过的占比,一个看拿去训练的轨迹平均得分,互相印证。

Mike

策略体检组是四张,策略熵是模型每一步的纠结程度,熵高说明还在到处试,塌到接近零说明只会一招了。梯度范数是更新的力度,突然爆炸式上涨往往意味着训练要出事。普通读者记住一句话就行,奖励涨、熵没塌、梯度没炸,就是健康的一步。

Sarah

规模与耗时组回答系统撑不撑得住,一共六张,前三个合起来描述活越干越复杂,后三个拆开告诉你时间花在哪,生成环节拖后腿多半是环境和沙箱的问题。

Mike

基础设施组是最诚实的一组,一共四张,基础设施失败占比记录卡坏了、环境挂了造成的浪费,平均陈旧度记录样本被采集和被拿去训练之间隔了几个策略版本。异步流水线不停转的代价就是样本可能是旧版本策略采的,陈旧度就是在量化这个时差。

Sarah

每个没跑完的任务下面还跟着动态采样区,左边是动态,右边是数据源表。左边是训练过程的施工日志,第几步做完、指标值多少、相对上一步涨跌多少、本步多少Token。右边是当前这一步的实时点名册,哪个数据集收了多少、判了多少分、还在环境里跑的有多少。

Mike

再往下是批次组成区,副标题写得直白,每步的样本是由什么构成的。左上角能切换三个维度,按数据源还是按执行框架看,看Pro还是Flash,用数量还是用占比。堆叠图看趋势,表格看最新一步的精确配比。这一区回答的是模型这一步到底上了哪几门课、每门课多少节。

Sarah

那成绩单和账单到底怎么样?还在初期,才练了一天多。Pro从0.565涨到0.614,Flash从0.514追到0.603。从Pro开训算起36小时,两款模型烧掉108万美元,平均一小时3万美元,一分钟4000多人民币。一眨眼,10美刀没了。

Mike

以前是关起门来烧钱,现在是打开门烧给你看。从上到下走一遍,账单跳多快,公告说什么,阶段处在哪,批量是多少,通过率涨跌几个点,故障单有几张?答得上来,你对强化学习的理解,就已经超过只看分数的人了。

Sarah

敢直播训练过程,这份自信本身就值得一个热搜。下次你打开这个页面,别只盯着奖励曲线往上翘,从上到下走一遍,保证看到的全是门道。

Mike

感谢收听从零开始学AI,把这期转给那个还在问强化学习是什么的朋友吧。

Sarah

下期见!

已复制