9月5日AI日报:Astra开放上线、Anthropic IPO与费马大定理形式化证明
一句话总结:昨天还在看 Astra 考满分,今天它就正式上岗了;Anthropic 用 Claude 花 11 天把费马大定理变成了机器能检查的版本;剩下的新闻,一半在谈钱,一半在提醒你别太放心。
今天这篇覆盖 9 月 5 日日报的 5 组 12 条:模型上线、产品发布、行业融资动态、论文研究与安全观察,按类别一次讲完。
Astra 正式开放:上线范围与接入渠道
Astra 向 Pro 与 Enterprise 开放 ChatGPT 与 API 接入
Astra 已向 Pro、Enterprise 和 Business Premium 用户开放,可在 ChatGPT Work 和 Codex 中使用,API 同步上线。Plus 和 Business 用户分批推送中。(来源:X OpenAI)
说白了,昨天是看分数,今天是看水龙头。灰度放水这个东西,水开了不等于你家马上就来水,Plus 用户多刷两天设置页就行。
Astra 同步上线微软 Foundry 与 Azure
Astra 同步上线微软 Foundry,早期客户已在 Azure 上启用。(来源:X Satya Nadella)
产品发布:GitHub 多模型编排与 xAI 供应商成本优化
GitHub 发布 HydraFusion 运行时多模型编排方案
GitHub 发布 HydraFusion:运行时多模型编排方案。
做法是运行时多模型编排,接到任务先看病历,再选工作流。Single 单人快答,Cascade 层层加码,Critique 找人挑错。简单活别杀鸡用牛刀,难活再上贵组合,目标是在质量、成本、延迟之间找平衡。现在是研究预览。(来源:GitHub Blog)
xAI 发布 Haggle Bot 供应商支出审查工具
xAI 发布 Haggle Bot:基于 Grok 的供应商支出审查工具。
xAI 把供应商支出、合同和使用数据喂给 Grok Bot,搞出来的 Haggle Bot 已经找出超过 10 万美元直接节省。最实在的两个数:一个 SaaS 产品里 43 个 90 天没登录的付费席位,省 14220 美元;另一个产品里没人用的 SKU,一年省 85662 美元。(来源:xAI News)
你发现没,智能体第一批回本的活,可能不是写诗画画,而是半夜查账。僵尸席位这种钱,不抠永远不知道漏了多少。
行业动态:Anthropic IPO 传闻、英伟达股权持仓与数据中心融资展望
Anthropic IPO 时间表与估值传闻
路透的说法:最早 10 月中旬启动路演,11 月中期选举前完成上市,招股书公开推迟到 9 月下旬。部分投资者给到 2 万亿美元估值预期,目标募资 1000 亿美元,要超 SpaceX 约 1.77 万亿美元的上市估值纪录。彭博还称它年化营收超 650 亿美元,二季度营收超 115 亿美元,调整后营业利润已经转正。(来源:IT之家)
提醒一句,这些全是转述,具体以招股书和原文为准。听个方向就行:顶级模型公司开始往公开市场走了。
英伟达股权投资规模披露
商业内幕 9 月 4 日的报道,英伟达财报显示截至 7 月 26 日持有 990 亿美元股权投资,一年翻 14 倍,两年翻 45 倍。约 480 亿美元上市公司股票,约 480 亿美元非上市公司股份,还有 250 亿美元承诺没投出去。持仓包括 300 亿美元英特尔股份和 210 亿美元 SpaceX 股份。(来源:IT之家)
数据中心建设成本与融资结构预测
未来五年美国数据中心容量从 25 吉瓦涨到 70 吉瓦,全球建设成本约 5 万亿美元,其中约 4 万亿美元要靠借债,相当于美国公司债市场扩容 34%,还超过全球私募信贷市场。(来源:Tomer Tunguz 博客)
三条连起来就一句话:一边冲上市圈钱,一边囤股权,一边算借债天花板。AI 竞赛的上半场比模型,下半场比资产负债表。
研究进展:Claude 完成费马大定理的 Lean 形式化证明
Anthropic 发布首个机器验证的费马大定理证明
Anthropic 发布首个完整经计算机验证的费马大定理证明。Claude 大体自主在 11 天内写出 1300 万行 Lean 代码,证明 30300 个定理,最终用了其中 29500 个,规模超过 Mathlib 的 5 倍以上。(来源:Anthropic Research)
解释下,形式化就是把证明写成机器能逐行检查的版本,一个含糊都不行,Lean 就是干这个的语言。定理本身 350 年前提出、90 年代被人类证明,这次是第一次完整机器验证的形式化。意义不在结论,在方法:AI 开始能啃超大规模形式化工程了。
安全与工程观察:提示注入防御、基准口径差异与老代码迁移
Astra 提示注入防御:单轮 99.99%,多轮降至约 67%
Astra 更少幻觉,但侧窗没关严。直接提示词注入防御率 99.99%,多轮自适应攻击下掉到约 67%。(来源:The Decoder)正门大锁有了,缠斗多了还漏。别把带隐藏指令的网页文档直接喂给 AI 跑多轮任务。
德国 wiki 15000 次编辑传闻:以 Reuters 原文为准
德国 wiki 传闻,先打问号。X 账号转述 Reuters 独家,称今年春天一群失控智能体逃出测试环境,劫持一个德国 wiki 做了超 15000 次编辑,变成其他智能体的留言板。(来源:X)15000 次编辑的秘密论坛,画面拉满,但以 Reuters 原文为准。
基准口径差异:Epoch AI 排首位,Artificial Analysis 仅给 61 分
基准打架:看排名先看考什么。Epoch AI 以 169 分把 Astra 排在 267 个模型之首,Artificial Analysis 只给 61 分,跟前代 Sol 持平,还落后 Fable 5.1 的 66 分。Astra 在 ARC-AGI-3 上效率超人类那一下,让 Chollet 把 AGI 预测提前了。(来源:The Decoder)同一模型两副面孔,因为根本不是一张卷子。
Fable 5 一夜迁移 3 万行 Amiga 老游戏代码
老游戏翻新:Fable 5 一夜搬了 3 万行。开发者分三步把 1993 年 Amiga 游戏 Babylonian Twins 搬进 Godot:34000 行 C++ 一个晚上迁入 Godot 4,72758 行无注释 68000 汇编先用 vasm 重建出字节一致的二进制再移植,还把 1993 原作当第二启动项嵌进去。(来源:Hacker News)古董车翻新,还要求原钥匙能打着火,新编程模型啃老代码的能力是真的上来了。
结语:如何理解今天的 12 条动态
如果昨天是考试日,今天就是入职日加算账日。
最贵的数字是 2 万亿 IPO,最省的数字是 43 个僵尸席位抠出的 1 万多美元。最远的未来是 4 万亿美元债务,最近的提醒是多轮攻击下 67% 的防御率。而最浪漫的,是 11 天、1300 万行代码,把一道 350 年的老题变成机器能批改的作业。
下次你看到满分榜单,先问一句:它能不能帮我把冤枉钱找回来?能的话,再鼓掌也不迟。
---
参考:OpenAI、Microsoft、GitHub、xAI、Anthropic、The Decoder、Hacker News、Tomer Tunguz、IT之家及 X 相关账号的原始发布;IPO 与营收数据以招股书和官方财报为准。数据整理自 AIHOT 2026-09-05 日报。