小米发布并开源MiMo-V2.6:Pro成最强开源模型,价格维持不变
小米今天正式发布并开源了 MiMo-V2.6 系列,Pro 和 Flash 两个原生全模态模型一起上。一句话总结:Pro 在 Artificial Analysis Intelligence Index 上拿到 46 分,超过 Kimi K3 和 Qwen3.8 Max,是当前最强的开源模型;定价沿用 V2.5 不变,同等智能下价格只有海外模型的 1/20 到 1/60。
跟最强的闭源模型 Claude Fable 5.1、GPT-6 Astra 比,小米自己承认还有差距。但开源阵营的头把交椅,这次换人坐了。
强在哪、贵在哪
先给结论。强:AA 综合智能指数 46 分,开源第一。 闭源那两位大佬还是高出一截,这个不用洗。
贵不贵:不贵,甚至更划算。 API 价格和 V2.5 完全一样,能力却往上拱了一大截——小米管这叫把「智能-成本」的帕累托前沿再往外推一圈。说人话就是:同样的钱,买到了更聪明的模型。
另一个硬指标在 Agent 榜单上:Pro 在多数 Agent Benchmark 上比肩 Claude Opus5 和 GPT-5.6 Sol,Flash 则全面超越上一代的 MiMo-V2.5-Pro。 一个开源模型追着闭源第一梯队跑,这事两年前没人敢想。
6天Live RL训练,两个模型烧了347万美元
这次升级的发动机是强化学习。小米把 RL 训练过程做了 Live 公开,历时不到 6 天:Flash 约 85 万美元、Pro 约 262 万美元,各跑 30 步,累计约 75 万条轨迹。6 天背后是半年的基础研究和工程试错。
效果直接反映在考分上:
- 训练任务平均通过率:Flash 相对提升 25%,Pro 提升 12%
- 样本外长程软件工程评测 DeepSWE v1.1:Flash 从 48.8 涨到 65.68(约 +17 分),Pro 从 58.4 涨到 72.57(约 +14 分)
DeepSWE 这个数值得单独看一眼——它测的是训练时没见过的题。模型不是把题库背熟了,是真学会了干活。 小米称 MiMo-V2.6 可能是目前国产开源模型里 RL 算力投入最多的之一,这个成本摆出来,确实不像小打小闹。
RL算力怎么扩的:更大的批次、更杂的题、更贵的判卷机
钱主要花在三个维度上。
更大的 Batch 与更高吞吐:单次更新用 1568 个样本,支持 100 万 Token 上下文训练,单步训练 Token 达 27 亿到 37 亿。这就像把教室从 30 人扩到 1500 人,一节课同时讲,效率自然上来。
更多任务与复杂环境:构建覆盖 Code、General、Visual、Cyber 的多任务体系,混着多个 Harness 训练。课表杂一点,学生才不会偏科。
更大的 Grader 算力:判卷的机器更聪明了——在一组答案里做相对比较,给长程任务更精准的奖励信号。你想啊,题目越难,判卷越糊,模型学到的就越歪;判卷准了,模型才知道哪条路是对的。
训练规模一大,幺蛾子也来了。小米的对策是冻结 MoE Router 抑制专家负载漂移,再建一套覆盖奖励设计、对抗性评测、异常检测和验证器交叉校验的 Reward Hacking 防线——防止模型学会骗过判卷机而不是学会做题。技术报告、训练环境和 RL 代码都已开源,想复现的可以去 Hugging Face 合集 拿。
从Vibe Coding到Vibe World:3D世界也能用嘴造
编程的边界被往外推了一段:MiMo-V2.6 融合 3D 空间推理、多模态感知和计算机操作(CUA),能把自然语言驱动的编程拓展成面向交互世界的构建,小米叫它 Vibe World。
具体长什么样:做 3D 开放世界游戏时,你丢一张图、一段视频或几句话进去,模型把需求拆成多个任务,多智能体协作搭场景、写交互逻辑、看渲染结果再改,一路迭代到吐出一个能跑的交互世界。Blender 建模也行——文字描述或参考图进,能用于动画、3D 打印和游戏的资产出。
具身智能那边更直观:以多视角相机画面为输入,通过视觉反馈闭环控制 Franka Panda 机械臂,完成抓取、颜色匹配和精准放置。CUA 则是理解复杂图形界面、操作常见办公软件,干完活自己看结果、排查问题、调整下一步。
科研两案例:筛污染材料与形式化混沌定理
MiMo-V2.6 没针对科研做过专项 RL 训练,但已经能上手干真活。
材料设计方面,在小米前沿材料研究团队的多轮交互下,Pro 提出了数种金属有机框架(MOF)材料设计方案,目标是吸附被称为「永久性污染物」的全氟和多氟烷基物质(PFAS)。它自己检索文献与专利、提假设、评新颖性,还跑了「干实验」:调用开源计算工具自动搭模拟环境,算出 MOF 与 PFAS 的结合强度,筛出最有潜力的候选,等人类去做湿实验验证。
形式化数学方面,Pro 在 Lean 4 中完成了 Li–Yorke 经典论文《周期三蕴含混沌》原始主定理的完整形式化——三周期轨道的存在足以推出所有正整数周期的轨道和一个不可数的混沌集。最终形成 6000 余行 Lean 源码,完整通过内核核验,没有留任何未完成证明占位。关键是:模型从没接受过 Lean 专项后训练。
设计与创作:Design Arena追平第一梯队
内容创作是这次的另一个主战场。在设计评测榜单 Design Arena 上,Pro 取得了与 Claude Opus 5、GPT-5.6 Sol 相近的水平。
前端和 PPT 能从一句简单指令生成完整界面,布局、组件、动画都自己安排,还会调 Figma 和图像/视频工具做配套素材。视频创作端到端完成:创意视频从视觉设计到镜头动效、配乐卡点;科普视频能把傅里叶分解、凸包这类抽象概念转成通俗解说加连贯动画,再用 MiMo-V2.5-TTS 合成旁白对齐画面。
音乐也有惊喜:Pro 根据要求创作了一首包含约十种乐器的管弦乐作品,写完乐谱自主转成 MIDI——乐器分工、配器关系、旋律编排,都像那么回事。
全面开源:模型权重之外,连训练环境都给了
开源不是只挂个权重。这次放出的东西相当全:
- Pro、Flash 模型权重与技术报告
- MiMo-V2.6-Distill-Qwen-9B 及配套 RL 研究资源
- 7k+ 高质量 RL 任务环境:覆盖软件工程、漏洞复现、知识型工作、网页设计开发。以 Distill-Qwen-9B 为起点训练,11 项评测全线提升:SWE-bench Verified 61.1→66.2,MiMo Cyber Bench 31.3→47.0,Terminal Bench 2.1 37.1→52.8,Visual Coding 64.0→72.4
- 端到端 RL 训练框架:基于 verl、uni-agent 和 mini-swe-agent,环境交互、轨迹采集、奖励评估、策略优化一条龙
- 轻量可组合的 Harness:把系统提示、工具与上下文管理解耦,支持 Multi-Harness Training,提升对没见过的框架的泛化
说白了,小米不只给了鱼,连渔具带鱼塘一块端出来了。社区拿 Distill 那个 9B 小模型就能自己跑 RL,这套资源对想搞 Agent RL 的团队相当实用。
怎么用:桌面客户端、API与UltraSpeed
Xiaomi MiMo Desktop 桌面客户端及会员订阅同步上线,订阅可用 Pro 和 Flash,也能配自己的 API Key。下载地址:mimo.xiaomimimo.com/desktop。原邀测活动 1 周后结束,已获资格的用户切换模型名后可继续用。
Pro 在桌面端和开放平台都提供 UltraSpeed 超高速模式,输出速度最高 20 倍,适合对响应速度敏感的场景。API 已上线 Xiaomi MiMo 开放平台,价格维持 V2.5 不变。
怎么理解这次发布
过去两年开源模型的剧本基本是:闭源先跑半年,开源再追半年。MiMo-V2.6 把这个时间差压短了——用 347 万美元、6 天 Live RL 和一次全面开源,证明了 RSI(递归自我改进)这条路在工程上真的能走。它引用的那句古话挺应景:夫夷以近,则游者众;险以远,则至者少。算力投进真实环境让模型自己试错,这条路更慢,也更少被看见。
榜单第一固然是新闻,但更值得记的是那行 DeepSWE 分数:没见过的题,也能多拿十几分。 至于价格——能力涨了、账单位移,这大概是消费者唯一不需要动脑的选择题。
哦对了,那个管弦乐 MIDI 转换是模型自己干的。所以下次有人说 AI 不懂艺术,你可以回一句:它连总谱都替你写好了。