一句话总结:谷歌把实时语音对话拆成两档卖,国内两家把视频和音频的实时能力直接摆上台面;另一边,有人忙着省下一亿美元,有人忙着给 AI 发展踩刹车。
今天这篇覆盖 9 月 15 日至 16 日的 4 组 13 条:模型发布、产品更新、行业动态、观点与榜单,一次讲完。
模型发布与更新
Google DeepMind发布Gemini 3.8 Live与Extended Thinking实时语音模型
DeepMind 这次一次发了两个:Gemini 3.8 Live 主打近实时语音对话,Extended Thinking 版则面向复杂任务执行。你可以理解成一个是“嘴快”,一个是“脑子更沉得住气”。
语音智能体这条线,说白了拼的就是两件事:打断跟得上,任务想得全。谷歌把两者拆开,等于告诉开发者——聊天和干活可以是同一套底座,两种付费姿势。你要是做语音助手、出海客服,这次可以直接去翻原文的延迟和任务评测。
生数科技发布Vidu S2:Avatar实时交互与Editing实时编辑双模型
生数这次把 S2 拆成了两块:Vidu S2-Avatar 做数字角色实时交互,Vidu S2-Editing 做视频流实时编辑,还顺手探索了面向 VR 头显的实时空间视频生成与编辑。
这个拆法挺实在的。你想啊,以前数字人是“播一段”,剪视频是“等渲染”,现在两边都想做到直播级——一边跟你对视聊天,一边按你的话改画面。对做直播、短剧、虚拟主播的朋友来说,可以去看看生数官方介绍里的演示,重点看实时性和可控性是不是真跟上了。
阶跃星辰发布StepAudio 3系列五款语音模型,多款登顶榜单
阶跃星辰这次是全家桶:StepAudio 3 系列含 Realtime、ASR、TTS、Gen 和 Music 五款,已在自家开放平台上线。据官方说法,多款在 Artificial Analysis 榜单拿下全球第一。
说真的,一次发五款还敢直接报榜单名次,是有点底气的。这就像一家店同时上了凉菜热菜主食甜点还都说自己是招牌——敢这么说,食客肯定要去尝一口。做中文语音、播客、音乐生成的同学,可以对照阶跃官方发布页看看评测口径和调用价格。
产品发布与更新
Google发布TranslateGemma开源翻译模型,语言技术覆盖超300种语言
谷歌这次讲的是一个大盘子:语言技术已支持超 300 种语言,覆盖全球 86% 人口,并发布了轻量开源翻译模型 TranslateGemma,基于 Gemini 训练、支持 55 种语言、可离线运行。细节见 Google 官方博客。
离线 + 开源 + 55 种语言,这组合是给手机和边缘设备准备的。你可以理解成,以前翻译要联网求云端,现在把一个小而准的翻译官直接塞进口袋。对出海应用和无网场景来说,这比参数规模实在多了。
Claude for Small Business新增43个工作流与27个集成,安装量超90万次
Anthropic 给小企业版加了料:新增 43 个工作流和 27 个集成,覆盖 Shopify、Salesforce、Stripe、Gusto 等,该产品自 5 月上线以来安装量超 90 万次。原文见 Claude 官方博客。
两个细节值得记。工作流默认是审批模式,所有发送、发布或付款都要你点一下头,这对小老板很友好——AI 干活,人签字。另一件事是培训:今秋在 10 个美国城市办免费工作坊,14 个集成伙伴从 9 月底到 11 月各办一场免费网络研讨会。说白了,模型卖完还得教人用,这才是小企业市场真正的门槛。
行业动态
Perplexity自研CobbleDB替代DynamoDB,年省至多一亿美元
Perplexity CEO 亲自下场宣布:自研键值数据库 CobbleDB,替代 AWS DynamoDB 做网页内容高速抓取,迁移后每年最多省一亿美元。更离谱的是人力投入——两名工程师加数百个持续运行的 Computer 智能体,两个月干完核心基建。官方数据称热存储批次读取 P50 延迟从 31.4ms 降到 5.60ms,约 5 倍提升。
这事有点离谱,但逻辑很顺。DynamoDB 是通用方案,按量付费;Perplexity 的抓取是固定高并发,把最烫的一块自己造,省钱又提速。你可以理解成天天点外卖的人终于自己开了个小食堂。对创业公司的提醒是:当某笔云账单大到离谱,重写它可能比砍功能更划算。
技巧与观点
Gergely Orosz探访OpenAI:Codex已成为内部工作底座
Pragmatic Engineer 的 Gergely Orosz 跑去 OpenAI 总部,访谈了七位工程师和工程负责人,结论是:自约一月起,Codex 和 ChatGPT Work 已成为公司几乎所有工作的基础。原文是那篇 OpenAI 软件工厂实录。
这不是“程序员用 Copilot 写代码”那种故事,而是全员把智能体当同事。你想啊,连做模型的人自己都离不开这套流程,说明智能体编程已经过了尝鲜期,进了靠它交 KPI 的阶段。我们这种普通团队,抄的不是工具,是他们怎么拆任务、怎么审结果。
Anthropic与OpenAI提议协调放缓前沿开发,Cohere CEO等质疑动机
Dario Amodei 呼吁行业和政府协调放缓前沿 AI 开发,并寻求反垄断豁免,Sam Altman 和 Elon Musk 表示同意。但 The Decoder 梳理的批评声也很直接,Cohere CEO 等人质疑这到底是为安全,还是为给头部争取时间。
说白了,这是 AI 圈的老话题换了新说法:刹车该谁踩,油门该谁加。大厂谈放缓,小厂听成了“别追了”。我们看热闹时记住一句话就行——凡是谈减速的,先看他自己有没有减速。
404 Media披露OpenAI莉莉计划:人工审核匿名聊天记录优化模型
据 404 Media 经 IT之家转述,OpenAI 内部有个代号莉莉计划的项目:时薪超 50 美元的审核员查看匿名化后的真实用户聊天记录,评判回复是否切题、有没有 AI 腔和谄媚味。
看到这条你会愣一下:我们天天调的“少拍马屁”,原来是真人一条条看出来的。你可以理解成请了一批口味很刁的试吃员,专门挑“油腻”这个毛病。提醒一句,你发给模型的字,匿名后也可能被拿去当教材,敏感东西还是掂量一下。
Arena更新Image-to-WebDev榜单:GPT-6 Astra以1733分登顶
Arena 刚更新了 Image-to-WebDev 榜,纳入四个新评测模型。GPT-6 Astra(Max)以 1733 分第一,领先 GPT-5.6 Sol(xHigh)129 分;Claude Fable 5.1(Max)1710 分第二,Muse Spark 1.3(Max)1645 分第四,GLM-5.3-Flash 1588 分第十。
这个榜是“看图写网页”,很考验前端还原。129 分的差距在 Arena 这种榜上不算小分,说明 Astra 的视觉到代码能力确实拉开了一档。国产 GLM 能进前十,也值得给个关注。
Artificial Analysis语音榜单:GPT-Live-1以81.5分登顶
另一块语音榜也更新了。Artificial Analysis 的 Speech to Speech Index 里,OpenAI 的 GPT-Live-1 以 81.5 分(Astra 后端、medium 推理强度)第一,超过 Grok Voice Think Fast 2.0 High 的 81.3 分;Sol 后端配置 80.1 分排第三。
0.2 分的差距,说白了就是贴身肉搏。你可以这么记:OpenAI 用 Astra 后端赢了 Grok 一头,自家 Sol 后端还紧跟在第三。做实时语音选型的人,直接去看原文的延迟和成本列,别只看分数。
Trail of Bits批评1Password AI补丁基准测试误导并发布验证技能
Trail of Bits 直接开火,批评 1Password 8 月 6 日发布的 FLAWED 报告:称其 26% 的 AI 干净修复率受四项实验设计影响而失真,包括 22% 数据用刻意让智能体用错修复的提示词、36% 试验禁止编译测试,以及不同的推理档位设置。原文见这篇长文复盘,他们还顺手发了两个补丁验证 Agent 技能。
这事给所有看榜的人提了个醒:分数好看,先看考卷是不是同一张。禁止编译测试去考修补,就像不让厨师尝味道却怪菜咸了。以后你看到“AI 修 bug 成功率”,多问一句测试条件,比记住数字管用。
Vercel销售团队从10人压缩至1.25人,AI销售智能体年成本仅数千美元
Vercel COO 在访谈里放了个狠数字:inbound 销售开发已实现 90% 自动化,团队从 10 人压到 1.25 人。Tomer Tunguz 算了笔账,AI 销售开发智能体的年成本只有几千美元。
1.25 人这个零头很有意思,说明还留了个人类兜底。你想啊,以前十个人轮班回线索,现在一个智能体全天不睡,成本从几十万美元年薪变成几千美元账单。对 SaaS 创始人来说,这不是“要不要试”,而是“线索回复这活还养专职吗”。
结语:省钱、减速与加速度在同一天
最省钱的数字是一年一亿美元,最拥挤的赛道是实时语音,最诚实的提醒是先看考卷再信分数,最魔幻的对比是有人喊减速、有人两周造完数据库。
下次你看到“又发新模型”,先别急着更新 SDK,多问一句:它是替你省了钱,还是替你省了等人的时间?答不上来,就先等等子弹飞一会儿。