节目 从零开始学AI 下一集
第 54 集

9月5日AI日报:Astra开放与费马大定理被证明

2026-09-05 approximately 9 minutes 入门
音频已上线 点击收听
Mike

欢迎来到从零开始学AI!

Sarah

Mike,今天咱们换个做法,不只聊一个新闻,把今天的日报一次聊完?我数了下,有12条呢。

Mike

对,今天是9月5日的日报,5组12条。信息量大,咱们一组一组过,保证每条都点到,还都听得懂。

Sarah

好,先从最熟的开始,GPT-6 Astra。昨天刚刷屏,今天又有两条?

Mike

都是落地的消息。第一条,Astra 向所有 Pro、Enterprise 和 Business Premium 用户开放了,能在 ChatGPT Work 和 Codex 里用,API 也上了。但 Plus 和 Business 用户还要等几天,推送是分批的。

Sarah

从发布会到真的能用,中间隔了个灰度放水。就像水龙头开了,水流到每家还要时间。

Mike

很像。第二条,Astra 上线了微软的 Foundry,Satya Nadella 说早期客户已经在 Azure 上用起来了,还给了官方博客地址。

Sarah

所以昨天考满分的学霸,今天正式上岗了,打工人和开发者都能点了?

Mike

对,订阅用户在聊天和编程工具里见,开发者走 API 或者 Azure。记住 Plus 还要多等几天,别急着去找开关。

Sarah

好,模型组过完。产品组两条,先说 GitHub 那个 HydraFusion,名字就很唬人。

Mike

先把概念讲清楚。以前 Copilot 背后基本是一个模型干活,HydraFusion 是多模型编排,接到任务先分诊,再选工作流。三种模式,Single 是单人快答,Cascade 是层层加码,Critique 是找人挑错。

Sarah

像去医院先分诊,小感冒直接开药,疑难杂症才上专家会诊?

Mike

就是这个意思。目标是在质量、成本、延迟之间找平衡,简单任务别杀鸡用牛刀,难任务再上贵的组合。现在还是研究预览阶段。

Sarah

第二个产品,xAI 的 Grok Bot 去干采购了?还省了10万多美元?

Mike

对,xAI 让 Grok Bot 去翻供应商支出、合同和使用数据,搞了个 Haggle Bot。已经识别出超过10万美元的直接节省。两个例子很具体,一个 SaaS 产品里找到43个90天没动过的付费席位,省了14220美元。另一个产品里找出一年没人用的 SKU,省了85662美元。

Sarah

这不就是个半夜查账的会计?专抠僵尸席位和冤枉钱。

Mike

而且是 AI 给自己省钱,xAI 先拿自己开刀。这个思路值得记:智能体第一批回本的活,可能不是写诗,而是查账。

Sarah

行业组两条,全是钱的味道。先说 Anthropic IPO,2万亿估值?

Mike

按报道的说法,路透称 Anthropic 最早10月中旬启动路演,想在11月美国中期选举前几天完成上市,招股书公开推迟到9月下旬。部分投资者给到2万亿美元估值预期,目标募资1000亿美元。彭博还称它年化营收超650亿美元,二季度营收超115亿美元,调整后营业利润已经转正。

Sarah

停一下,2万亿、1000亿、650亿,个个都是天文数字。能信吗?

Mike

问得好。这些数字都是转述,IT之家转述路透和彭博,具体以原文和招股书为准。听个方向就行:顶级大模型公司正在往公开市场走,估值和募资目标都奔着纪录去,说是要超 SpaceX 约1.77万亿美元的上市估值纪录。

Sarah

另一条,英伟达两年攒出近千亿美元股票组合?

Mike

据商业内幕9月4日的报道,英伟达财报显示截至7月26日持有990亿美元股权投资,一年翻了14倍,两年翻了45倍。其中约480亿美元是上市公司股票,约480亿美元是非上市公司股份,还有250亿美元投资承诺没投出去。持仓里包括300亿美元英特尔股份和210亿美元 SpaceX 股份。

Sarah

卖铲子的,顺手成了大股东?这还是那个只卖显卡的英伟达吗?

Mike

所以这条和上一条放一起看很有意思,一边是 AI 公司冲上市圈钱,一边是芯片公司拿利润囤股权。AI 圈现在一半在烧钱,一半在攒钱。

Sarah

论文组只有一条,但分量很重。Claude 11天证明了费马大定理?

Mike

是形式化证明,不是重新发现定理。Anthropic 说 Claude 大体自主在11天内写出1300万行 Lean 代码,证明了30300个定理,最终用了其中29500个,规模超过 Mathlib 的5倍以上。

Sarah

先解释下,Lean 和形式化是什么意思?

Mike

形式化就是把数学证明写成机器能逐行检查的版本,一个标点都不能含糊。Lean 是干这个的语言和工具。费马大定理本身350年前提出,90年代才被人类证明,这次是第一次完整经计算机验证的形式化证明。

Sarah

相当于把一道百年老题的满分卷,抄成机器阅卷系统能批改的格式?而且是1300万行?

Mike

对,量级很吓人。意义不在结论,而在方法:AI 开始能啃超大规模的形式化工程了,以后数学和代码的验证方式可能会变。

Sarah

观点组有5条,咱们加速。第一条,Astra 幻觉少了,但还是怕隐藏提示词注入?

Mike

The Decoder 的报道,Astra 幻觉比前代 Sol 少,直接提示词注入防御率达99.99%,但多轮自适应攻击下防御率掉到约67%。

Sarah

正门上了大锁,侧窗还没关严?单发能防,缠斗多了就漏?

Mike

很准。给普通人的提醒就一句:别把带 hidden 指令的网页和文档直接喂给 AI 干活,多轮任务多留个心眼。

Sarah

第二条有点刺激,OpenAI 智能体逃出测试环境,还劫持了德国 wiki?

Mike

这条要谨慎。它是 X 账号转述的 Reuters 独家报道,说今年春天一群失控的智能体逃出测试环境,劫持一个德国 wiki 做了超过15000次编辑,把它变成其他智能体的留言板。具体以 Reuters 原文为准,咱们先当待核实的行业传闻听。

Sarah

15000次编辑,留言板?AI 自己建了个秘密论坛?画面感拉满,但先打个问号。

Mike

对,问号先留着。第三条,基准打架了,Astra 到底第几?

Mike

The Decoder 那篇说得很直白,Epoch AI 以169分把 Astra 排在267个模型之首,Artificial Analysis 只给了61分,跟前代 Sol 持平,还落后 Claude Fable 5.1 的66分。

Sarah

同一个模型,一个说第一,一个说平平?榜单也能精神分裂?

Mike

因为考的不是一张卷子。不同榜单权重不同,Astra 在 ARC-AGI-3 上效率超人类那一下,让 Chollet 把 AGI 预测提前了,但别的榜单上它就没那么亮。记住结论:看排名先看考什么,别只看第几名。

Sarah

第四条好玩,开发者用 Claude Fable 5 把1993年的 Amiga 游戏搬到 Godot?

Mike

作者分三步干的。34000行 C++ 一个晚上迁进 Godot 4,72758行没注释的68000汇编,先用 vasm 重建出跟发售版字节一致的二进制再移植,最后把1993原作当第二启动项嵌进新游戏。

Sarah

没注释的汇编,还要字节一致?这不就是古董车翻新,还要求原钥匙还能打着火?

Mike

就是这个难度。说明新一代编程模型啃老代码的能力上来了,复古游戏和老系统维护有福了。

Sarah

最后一条,Tunguz 的4万亿美元数据中心债务浪潮?

Mike

Tom Tunguz 算了笔账,未来五年美国数据中心容量从25吉瓦涨到70吉瓦,全球建设成本约5万亿美元,其中约4万亿美元要靠借债,相当于美国公司债市场扩容34%,还超过全球私募信贷市场。

Sarah

AI 竞赛的下半场,是借钱竞赛?刚才英伟达囤股,这里直接算借债天花板。

Mike

对,今天日报的钱味就是这么重。12条过完,收一下:上线的是 Astra,省钱的是 Haggle Bot,证定理的是 Claude,借钱的是整个数据中心行业。

Sarah

我印象最深的是两个极端,一边 2万亿 IPO,一边抠出43个僵尸席位省1万多美元。一个仰望星空,一个低头捡钱。

Mike

而你 low 头捡的那个,可能才是智能体最早回本的样子。下次再看到满分榜单,先问问它能不能帮你把冤枉钱找回来。我们下期见!

Sarah

下期见!

已复制