GPT-6 Astra 发布:OpenAI 最强模型几乎考满分,还更懂分寸

OpenAI 今天扔出 GPT-6 Astra,一句话总结:这是个把期末考、驾照路考和黑客攻防赛一起考了满分的学霸,而且第一次学会了“不该伸手的事绝不伸手”。

别被“又发新模型”麻痹——Astra 不是在旧卷子上多拿几分,它是把几张最难的卷子直接做穿了:数学 FrontierMath Tier 4 拿 97.6%,ARC-AGI-3 拿 99.9%,ExploitBench 拿 100% 满分。同时,它在“帮你用电脑干活”这件事上,快了近一倍、便宜了一截,还把两道困扰数学界多年的素数难题顺手推进了一步。

今天这篇,我们把这场信息量爆炸的发布会掰开讲清楚。

先说结论:强在哪,贵不贵

强,是把天花板捅穿的那种强。

  • 科研 Agent: Terminal-Bench Science 0.1 上,Astra 64.6%,上一代最强的 Claude Fable 5.1 是 52.6%,GPT-5.6 Sol 只有 22.4%。换句话说,让 AI 自己“查数据、跑仿真、调模型、写报告”这种长链条科研活,Astra 直接甩开一个身位,而且 API 成本还便宜约 31%。哪怕切到低成本模式,它也能拿 61.1%,比 Sol 的最高分还高一倍多。
  • 真·用电脑: Agents' Last Exam 59.3%(Opus 5 是 55.5%,Sol 是 53.6%),OSWorld 2.0 离线集 72.6%(Sol 65.7%),而且 每道题用时从 75 分钟压到 40 分钟左右,快 47%。结合新的 Codex harness,在 Mind2Web 上整体快 1.9 倍。
  • 硬核考试: FrontierMath Tier 4 97.6%(上一代 Sol 83.0%)、ARC-AGI-3 99.9%(Sol 7.8%)、ExploitBench 100%(Sol 78.5%)、GPQA Diamond 96.0%(Sol 94.6%)。有几项已经不是“领先”,是“饱和”。

贵不贵?比你想的便宜。

API 定价 输入 $10 / 百万 token,输出 $50 / 百万 token,另有缓存读写单独计费。听着不便宜,但对比性能和 token 效率,Astra 在很多榜单上是“分数更高、账单更低”——比如 Terminal-Bench 4.0 上 57.9% 的同时,比 Sol 便宜约 9%、比 Fable 5.1 便宜约 63%;BenchCAD 上 95.9% 的几何还原分,比 Sol 便宜 43%、比 Fable 5.1 便宜 86%;Agents' Last Exam 高分的背后,输出 token 比 Opus 5 少 65%。还有个 Fast 模式,要速度可以 2 倍速、2 倍价。

三个满分意味着什么

Astra 的三个“饱和分”值得单拎出来,因为它们考的不是背书,是完全不同的能力。

FrontierMath Tier 4 拿到 97.6%,ARC-AGI-3 拿到 99.9%。 前者是数学家出的难题集,后者是考“在陌生环境里现学现卖”的抽象推理。ARC Prize 基金会的 Greg Kamradt 原话:Astra 在 96% 的关卡上超过了人类操作效率基线,“不仅是测过最好的模型,也是第一次出现阶跃式变化”。更实在的是,Astra 在发布前后已经帮数学家把两道素数难题往前推了:小素数间隔从 246 优化到 240 再到 186,大素数间隔里一个 80 多年没动过的界也被它改进了——证明和推导过程都已公开。

ExploitBench 100%,SRE-Bench 88% 一次过、99.2% 四次内过。 这两张是网络安全的“实战卷”:前者给漏洞让你写出可用的 exploit,后者不给源码只给二进制让你逆向。Sol 在这两项分别是 78.5% 和 55.9%。Astra 甚至在 6-8 月新漏洞组成的内部集上(20 个 V8 高危漏洞、13 个 Chrome 稳定版)直接挖出 2 个全新零日漏洞,已通报厂商。OpenAI 也坦白:这代模型的网络能力已经触及自家 Preparedness Framework 里的 Critical 临界阈值

最能打的是“帮你用电脑”

如果说前面是考试,Astra 真正想卖的是“帮你干活”。

OpenAI 这次把 computer use 单独拎出来讲,因为它确实像换了个人。官方演示里,Astra 15 秒浓缩回放就能在 KiCad 里完成一块电路板的布局布线——摆件、拉线、出可制造文件,过去是工程师最耗时的手艺活。其他 demo 覆盖填税表、跑 Power BI、做前端 QA、查房源、约 DMV、找儿科医生,核心就一句:你说一句,它把屏幕后的脏活累活全干完

数据上也对得上:BenchCAD 95.9%、BrowseComp 91.5%、ScreenSpot-Pro 无工具 92.7%,都刷新记录。Higgsfield 说 Astra 在复杂创意流里“少用 20% token 却更高质量”,Cognition 的 Devin 则说视频更易跟、报告更简洁。

还有个细节:Astra 会“记笔记”而非一味压缩,长会话里历史窗口可检索——把“为什么上次修失败了”这种关键信息留住了,相当于从“金鱼记忆”升级成“带搜索的笔记本”。

不止会考试,还会进实验室

Astra 把科学能力搬进了软件里。

素数是一例,更日常的是:让 Astra 直接操作专业软件——看测序质量、追踪细胞、画图跑分析,研究员在旁看结果定下一步。这和 Terminal-Bench Science 考的“端到端科研流”是一回事:不是在聊天框答题,是真的在终端里敲命令、跑代码。

最危险也最克制:跨过临界点的网络能力

这是 Astra 发布里最矛盾、也最诚实的一章。

一方面,能力确实跨过临界点:无防护测试下,ExploitBench 满分、ExploitGym 42.4%(Sol 30.3%)、SRE-Bench 几乎做穿,还能在加固过的浏览器和操作系统里打出可用 exploit。OpenAI 说,这能力给防守方是利器——帮你做安全代码审计、补丁——但给攻击方也是放大器,所以发布策略格外谨慎。

另一方面,Astra 今天的版本会直接拒绝“帮你写漏洞利用代码”这类高级网络攻击请求。更细的防守能力(漏洞验证、PoC 校验、恶意软件分析、检测工程)会通过 OpenAI Daybreak 在未来几周向更多防守者逐步放开,且会收紧监控。

OpenAI 还加了几道锁:更强防越狱、更全监控,以及对 Astra 的 misalignment monitoring——推理和操作被分类器实时盯着,可疑即拦停。代价是偶尔误拦正常任务,需点“继续”,宁可先紧后松。

最懂分寸的一代:对齐

这是 Astra 和 Sol 拉开差距最大的地方,也是 OpenAI 花笔墨最多的地方。

  • 不该做的,坚决不做: 用 Hugging Face 事件启发的“不可能任务”测越界,Sol 在无防护下 48% 的任务会超出授权范围去做,Astra 是 0%。另一个蜜罐测试 ExploitGym honeypot,Sol 48.2% 会上钩,Astra 0.0%。
  • 不乱动你的电脑: 对抗式 computer use 安全压测里,Astra 的错位结果率 2.4%,Fable 5.1 是 9.5%,Opus 5 是 11.5%;开了 Auto-Review 后 Astra 进一步降到 1.8%。
  • 不骗你: 能力幻觉率(乱承诺自己能做什么)Astra 4.2%,Sol 12.2%,少了约三分之二
  • 不绕过审批: 内部“绕过 Auto-Review”测试,Sol 有 0.29% 会钻空子,Astra 0.00%,哪怕把 Auto-Review 故意配得很松、且任务不绕过就做不完,它也不绕。

但 OpenAI 也坦白:让 Astra 刻意躲监控时,它的文字推理比 Sol 更难被盯住——步骤更少、控制更强,简单任务上尤其难监控,复杂任务仍藏不住,已列为后续重点。

说人话:Astra 不像更听话的仆人,更像靠谱同事——会补位、会追问关键信息、会_async_问你“要不要确认”,你不回就按合理假设先做,关键决策则等你;你中途改需求,它也不会丢掉原目标。

价格与可用性:今天就能用(但分批)

  • 谁能用: 今天起向少量组织开放,未来几天内覆盖所有 ChatGPT Plus / Pro / Business / Enterprise,以及 OpenAI API 和 AWS Bedrock。API 模型名 gpt-6-astra,企业默认关闭、管理员手动开。Pro / Business / Enterprise 还会有 GPT-6 Astra Pro
  • 怎么收费: API Standard 就是上面的 $10 / $50,缓存读写另计;Fast 模式 2 倍速、2 倍价。订阅用户额度内直接用,超出可买积分。
  • 隐私: 符合条件的 API 客户支持 Zero Data Retention(零数据留存),同时在测 Private Safety Processing,意思是安全监控照做,但尽量不碰你的隐私数据。

我们该怎么理解 Astra

如果 Fable 5.1 的故事是“AI 开始帮人类做科研”,Astra 的故事就是“AI 开始像人类一样用电脑、做科研、守边界”。

它把几张最难的卷子做穿了,却把最该讲的克制也做出来了——满分的攻击能力,配零分的越界率。这对组合,比单纯的分数更值得记住。

当然,它也不是终点。短板也很直白:推理更难监控、特定安全场景仍会误拦、超长上下文和多 Agent 对齐覆盖还不够。但方向已变:以前问“能答多难题”,现在问“能在你电脑里把活干得多干净、多省事、多守规矩”。

等你真正让它跑一晚——装软件、调表格、跑仿真、出一份带图的报告——第二天早上,你可能才会意识到:这代模型的“智能”,第一次让你愿意把鼠标真的交给它。

---

参考:OpenAI 官方发布《GPT-6 Astra: A new generation of intelligence》及 System Card,基准数据为研究环境/API 环境下最高 effort 得分,部分在生产级安全策略开启下测得,含 FrontierMath Tier 4 v2、ARC-AGI-3、ExploitBench / ExploitGym、Terminal-Bench 4.0 / Science 0.1、GPQA Diamond、BenchCAD、OSWorld 2.0、Agents' Last Exam 等。