小米的桌面 AI,今天把门打开了一条缝。

一句话总结:MiMo Desktop 不想再做一个更会聊天的助手,它想做一个能交活的同事,MiMo-X 双 Preview 模型限时免费给你用。 你扔过去一堆乱七八糟的素材,它还你一份能直接用的文档、PPT、网页,甚至 3D 和 App。申请页已经上线:mimo.xiaomimimo.com/desktop/invite/。

说白了,以前的 AI 是你问它答。现在这个,是你说目标,它交结果。像你请了个装修队,你不用教它怎么和水泥,你只说想要什么风格的家。

先说结论:桌面应用与双模型 Preview 邀测内容

一款桌面应用 + 两款新模型 Preview,限时、限量、免费。 应用叫 MiMo Desktop,模型代号 MiMo-X-Pro-Preview 与 MiMo-X-Flash-Preview,通过申请才能下载体验。

定位很直白:面向真实工作场景的桌面 AI 应用。官方原话是接收多格式素材、理解目标、拆解任务、调用工具、交付高可用度成果,还支持实时预览与修改。这次邀测要验证的,就是长链路执行、工具调用、交付质量和使用体验的边界。

申请方式也简单,打开邀测页提交申请,审核通过就能用。优先面向 Xiaomi MiMo 开放平台已有用户开放,评论区已经挤满了报 UID 求通过的人,92 条留言几乎全是“已申请,莫辜负”。

从回答问题到交付成果:多格式素材输入与可编辑成果交付

真实工作很少从一句干净的提示词开始。你手头往往是表格、图片、视频、PDF、录音,乃至没解压的压缩包,全堆在一起就是任务本身。

MiMo Desktop 可以直接读取这些混合素材,无需预先整理或转换格式。 你用自然语言说清目标,它负责理解素材、拆任务、调工具,最后交出可继续编辑的成果:文档、表格、幻灯片、网页、图片、音频、视频,甚至是 3D 模型、App 或软件工程项目

官方给了两个工作流例子,很能说明思路。PPT 工作流是混合素材输入 → 事实与数据梳理 → 叙事结构设计 → 图表与版式生成 → 交付可修改的 PPT。Figma 工作流是自然语言输入 → 理解任务 → 规划工作流 → 调用 MCP 控制 Figma → 实时生成设计元素 → 交付成果。

你想啊,这就像你把菜市场买回来的一大袋菜直接倒在桌上,跟大厨说一句今晚吃川菜。大厨自己摘菜洗菜配菜,最后端上来一桌席面,你还能说这个辣了点拿回去改改。

可交互预览界面:成果支持直接操作与继续修改

很多 AI 的预览就是一张图,看着好看,动不了。MiMo Desktop 这次强调的恰恰相反。

它的“成果预览”包含组件结构、交互逻辑、状态变化和数据可视化,支持直接在会话中点击、操作和继续修改。 生成轻量游戏原型、复杂数据网页、Office 文件和动态 Demo 时,不用先搭本地前端环境,就在聊天窗口里试,试完接着改。

官方一口气贴了四个例子。3D 交互式网页:城堡、摩天轮和旋转木马,周围是极光,城堡还能变换灯光秀,全放在一个 html 里。3D 游戏:用 three.js 做 SnowRunner 风格足球游戏,主角是越野卡车,在泥地里踢球带跳跃加速特技。高阶 PPT:介绍意大利,图文并茂要有高级感。图文调研报告:深度调研徽派建筑的历史结构与空间特征,结构清晰还要图文并茂。

说真的我没想到,桌面 Agent 已经卷到这种程度了。以前是你说需求它给你代码,你自己跑。现在是代码跑起来的样子直接摆你面前,你上手点两下,哪里别扭改哪里。

在成果上继续工作:选区局部修改与版本回退

交付不是结束,返工才是日常。这部分是我觉得最贴近打工人的设计。

用户可以直接选中会话或产物的任意元素、文本段落、图表或表格区域,用自然语言描述修改要求。 选区会限定作用范围,MiMo Desktop 只处理你圈住的那块,不用重新生成完整成果,也不用重复交代背景。比如在 PPT 里局部修改:选中范围 → 描述意见 → 局部实时重生成。

这事有点离谱的地方在于,它解决了 AI 最气人的毛病。以前你让 AI 改 PPT 里一句话,它能把整份配色都给你换了。现在是只动你圈的地方,别的不碰。像改 Word 用修订模式,圈哪改哪,干净利落。

而且每次修改都会保留版本记录,可以比较不同方案,随时回退历史版本。你完全可以让它出三个版本摆在一起挑,挑花眼了还能一键回到第一版。做方案的人都懂,这功能能救命。

Smart 调度:自动评估任务并匹配模型与 Agent 路径

模型越来越多,Agent、Skill、Harness 一堆名词,用户哪分得清该用哪个。MiMo Desktop 干脆说:你别管了。

内置「Smart」调度模式,可自动评估任务类型、复杂程度、交付要求和执行成本,再匹配最适合的执行路径。 它会先识别任务属于办公、编程、研究、设计还是混合场景,再判断所需推理深度、工具范围和交付标准。

模型路由的逻辑很实在:日常任务优先标准模型,速度快成本低;复杂推理、长链路执行和高质量交付用旗舰模型。Harness、Agent、Skill 也是按需路由,大型任务可拆给多个 Agent,分别负责调研、规划、执行和复核,执行中自动调用不同 Skill。还能按需组成多角色会话团队,每个会话有独立记忆、工作区和任务状态,彼此自动通信协作。

打个比方,以前是你进饭馆还得自己进后厨点兵点将,哪个厨子炒哪个菜你来定。现在你是报菜名,店长自己看客流量派人,快餐小炒派学徒,满汉全席上大师傅。你只管吃,好不好吃店长负责。

浏览器操控与长任务成本控制:自主执行与缓存优化

这两块是放一起看才有味道,一个管能力,一个管成本。

能力这头,MiMo Desktop 可以自主控制电脑浏览器,打开网页、检索信息、填写表单、提取素材。浏览器不只是信息来源,也是执行环境的一部分。调研来的资料直接进当前任务,不用你复制粘贴两头跑。生成网页类成果时,它还能用浏览器检查关键交互,自动验证一遍。

成本这头,官方给了三个省钱招:Smart 调度按复杂度选模型、局部编辑只重算改动部分、高缓存命中减少重复计算。数字给得很具体:同会话缓存命中率最高可达 99%,跨会话最高可达 95%。长任务最怕的就是 token 哗哗烧,这个数要是真实测出来的,对重度用户就是实打实的折扣。

评论区有人一句话点破了:动态调度太切痛点了,加上超高缓存命中率,都是 token 实惠。确实,Agent 好不好用,最后都得落到账单上。

新模型与申请方式:MiMo-X 双 Preview 面向专业场景优化

邀测期间的核心甜头,就是两款新模型。

MiMo-X-Pro-Preview 与 MiMo-X-Flash-Preview,面向真实专业工作场景优化,重点覆盖复杂任务推理、多 Agent 协作、大型编程项目、Office、网页设计、前端与交互设计、视频剪辑、3D 生成、音乐生成、电脑操控等。官方也留了个尾巴:仍处预览测试阶段,能力表现可能随版本迭代变化,你的真实任务反馈会用来做后续评估。

怎么拿到资格?访问 https://mimo.xiaomimimo.com/desktop/invite/ 提交申请,审核通过后下载使用,本次优先开放平台老用户。有用户问是不是 V3,有没有每日免费额度,官方还没细说,Preview 的命名方式看,更像新一代系的抢先版。

官方在最后写了一句挺大的话:AGI 的意义,不止于理解世界,更在于帮助每个人创造世界。 MiMo Desktop 是迈入真实工作流、把想法转成高质量成果的第一步。

收口:桌面 Agent 竞争转向成果交付能力

MiMo Desktop 的思路其实就一句:别比谁更会回答,比谁更会交卷。

从混合素材直接读,到可交互预览,到圈选局部改,到 Smart 派活,到浏览器自己查自己验,再到 99% 缓存命中 省下真金白银,每一步都在把“聊天”往“交付”上拽。交出来的东西能点、能改、能回退,这才叫成果,不然就还是半成品。

当然,Preview 就是 Preview,边界得靠真实任务一点点试出来。评论区最高赞的那句“牛牛牛”之后,紧跟着的就是“不知道和其他 Agent 相比怎么样”。能申请的朋友,不妨拿你手头最头疼的那个活去试试——比如那份拖了两周的 PPT,或者那个没解压的素材包。

毕竟检验桌面 Agent 的唯一标准,就是它能不能让你准时下班。