Qwen3.8-Omni-Flash上线:原生全模态Agent,百万Token输入0.8元

一句话总结:Qwen新一代原生全模态模型上线百炼,能看会听还能直接交活,输入全模态同价0.8元起。你可以把它理解成,以前AI是帮你看完视频写个观后感,现在是看完直接把剪辑、翻译、纪要和后续动作全干完。

今天的主角是 Qwen3.8-Omni-Flash,刚在阿里云百炼上线。说真的,全模态模型今年不少,但把“规划任务、调用工具、完成创作”写进目标里的,这次算讲得最具体的一个。

先说结论:三类生产力任务,评测平均提升超25%

先把定位摆出来,读完你就知道它想干嘛了。

面向真实生产力场景,覆盖通用Agent、音视频创作、知识沉淀三类工作。通用Agent管编程、文本知识工作和GUI操作,音视频创作管剪辑、Music2MV、视频翻译和影视解说,知识沉淀管音视频转图文摘要、Video2Note和Agent Skill创建。

官方汇总29项音频、音视频与Agent评测,相比Qwen3.5-Omni-Plus平均提升超25%。跑分看看就好,更值得看的是解法变了:从被动回答,变成主动取证加工具执行。

调用方式是阿里云百炼API,模型ID为qwen3.8-omni-flash。实时版Qwen3.8-Omni-Flash-Realtime还没开,体验中心也会跟进。想搭长视频、剪辑和知识库工作流的,可以再接 Qwen-MM-Plugins

长音视频理解:44分钟素材中定位6秒关键片段

长视频最烦的是什么?你想啊,44分钟会议录像,你只想找一句话,得从头拖进度条。

Qwen3.8这次给的解法是按需描述加主动取证。看什么、看多细、怎么呈现,你直接提要求:指定描述对象、时间范围、信息粒度和输出格式,人物动作、镜头、光影和声音分开讲。

找东西不用全看完。模型先粗扫再放大取证,案例中从44分钟素材里定位到关键6秒。官方实验里,这套做法让准确率从63.4提升到67.8,Token消耗还下降约45.7%。说白了,就是先翻目录再读正文,又准又省。

开会场景更实用:联合画面和声音认出多位发言人,输出纪要、待办和风险。这还没完,接上工具还能继续发邮件、整理任务或者开始写代码。你把它想成一个听完全场还不走的实习生,纪要写完顺手把活也领了。

音视频创作:从歌曲到MV,从视频翻译到电影解说

看懂只是上半场,这代模型想卖的是“交成片”。

第一种活,是从一首歌出发做完一支MV。模型先听懂歌曲结构、节奏、情绪、人声和乐器变化,再规划人物、场景和镜头,并让字幕和画面对齐,还顺手做成品质检。相当于导演、剪辑和质检坐一桌,一次开完会。

第二种活,是一句话实现视频出海。区分角色、口语化翻译、克隆音色、对齐台词时长,再重新混音和质检。你给一条中文视频,它还你一条能直接发的本地化版本。

第三种活,是一部电影一句话生成解说成片。梳理情节、挑选镜头、规划解说词、配音配乐,再做剪辑渲染和成片质检,让解说、原声、背景音乐和画面自然衔接。有点离谱的是,这种以前要一个小团队熬几天的活,现在被压成一条工作流。

知识沉淀:教程视频转手册,录屏演示转可复用Skill

还有一类容易被忽略的活:把看过的内容,变成以后能用的资产。

比如学习:把教程视频压缩成图文操作手册。自动梳理知识结构、拆分步骤、挑选关键画面,生成图文PDF,再自动审阅迭代修正。线性视频看完就忘,变成可检索可复习的手册才值钱。

比如复用经验:看一次录屏,学会一套工作流。从操作演示里提炼SOP、工具用法和判断依据,再生成经过校验的可复用Agent Skill。老师傅演示一遍,活就留下来了,新人不用再问三遍。

最狠的是自己训自己:给出目标后自主诊断、造数据、多轮实验。官方给的例子是12小时内跑完4轮实验,累计构建3413条训练数据,把四川话识别字符错误率从25.79%降到15.30%。你没看错,模型开始参与数据构建、训练和评测,反过来帮小模型变强。

价格与接入:全模态同价,百万Token输入0.8元

这次不只讲能力,价格也动了刀。

相比上一代Qwen3.5-Omni系列,输入不再区分文本、图像、音频或视频,全模态同价。这事对开发者很实在,以前最怕传个视频账单爆炸,现在输入输出一口价,心里有数。

中国内地百炼价格是输入0.8元每百万Token,缓存命中输入0.1元每百万Token,输出2.7元每百万Token。实际费用、缓存命中规则、可用地域和计费方式,以百炼控制台最新页面为准,引用报价回原文核对一遍最稳。

接入路径很短:百炼API直接调qwen3.8-omni-flash,需要长视频记忆、视频剪辑、Video2Note和Skill Creator这类完整工作流,再叠加Qwen-MM-Plugins。官方博客和插件仓库链接都在上文,照着接就行。

怎么理解:全模态从内容理解走向任务交付

我们熟悉的全模态,是“给你看、给你听、给你讲明白”。Qwen3.8想讲的是下一句:把声音、画面和时间线接进任务规划和工具执行

考核也换了:以前比谁描述得细,现在比谁找得准、干得完、还能把经验留下来。44分钟找6秒是找得准,MV和解说成片是干得完,手册和Skill是留下来。

结尾留个好玩的吧。以前我们说AI看视频,是请了个记忆力超群的观众;现在,更像请了个不爱说话的场务——你说一句“剪出来、翻出去、发出去”,它灯光音响字幕全包,完事还把流程写成手册贴墙上。