Claude Fable 5.1 发布:最强编程模型又变强了,价格还便宜了 45%
2026 年 9 月,Anthropic 扔出一枚重磅炸弹:Claude Fable 5.1 和 Claude Mythos 5.1。
一句话总结:这是目前最强的编程和知识工作模型,同时也是第一个真正开始帮人类做科研的 AI。 而且,它变便宜了,还更好用了。
别被两个名字吓到——它们是同一个模型,只是安全枷锁不同。 Fable 5.1 人人可用,Mythos 5.1 则专门开放给做网络安全和生命科学的可信研究者。就像同一辆跑车,一辆是民用版,一辆是赛道版。
今天这篇,我们把这场发布会掰开揉碎,用大白话讲清楚。
先说结论:强在哪,便宜在哪
很多人关心两个问题:比上一代强多少?贵不贵?
答案都很直接。
强,是断崖式领先。 在最能体现“AI 能不能像人一样做科研”的榜单 Terminal-Bench-Science 上,Fable 5 从 24.7% 直接飙到 Fable 5.1 的 52.6%——翻了一倍多。Opus 5 才 29.0%,GPT-5.6 Sol 只有 22.4%。换句话说,这一代在“自己查资料、跑代码、做实验、写报告”这种长链条科研任务上,已经把上一代和竞品甩开了。
其他榜单也一样:知识工作 GDPval-AA v2 拿到 1853 分(上一代 1723),自动化办公 AutomationBench 从 17.1% 涨到 31.4%,Cursor 上的编程能力也拿下 73.4% 的最高分。
便宜,是真的便宜。 Fable 5.1 官方定价输入 $10 / 百万 token、输出 $50 / 百万 token 没变,但缓存读取(cache reads)降价 75%,只要 $0.25 / 百万 token。
这是什么意思?你可以理解为:AI 干活时,会反复读之前已经看过的内容,以前这部分很贵,现在几乎不要钱了。所以——
- 普通工作流,整体便宜约 25%
- 越是复杂的 Agent 任务(一直在读代码、查文档、跑工具),最高便宜约 45%
投资公司 Millennium 的一个故事最有说服力:一个百万分之一概率才会触发的偶发崩溃,团队几年都没定位到原因,Fable 5.1 直接反编译外部供应商的库,对着 core dump 把根因揪出来了——以前根本不敢为这种问题花这么多人力。
为什么是两个名字?一辆车的两个版本
Fable 和 Mythos 本质是同一个大脑,区别只在安全围栏的松紧。
- Claude Fable 5.1:通用版,人人可用。安全策略更精准了——以前经常误拦的正常问题(比如问个医学常识、让它帮忙找代码漏洞),现在生物类误拦少 85%,网络安全类误拦少 60%。而且,Fable 5.1 现在可以帮你做漏洞发现了(但不能帮你写攻击代码)。
- Claude Mythos 5.1:专业版,只给可信机构。网络安全和生命科学的高阶能力,需要通过两个验证项目申请:Cyber Verification Program(CVP) 和 Life Sciences Verification Program(LSVP),后者还是和美国政府合作推出的。Anthropic 的扫描产品 Claude Security,已经直接用 Mythos 5.1 驱动了。
简单记:想日常写代码、做知识工作,用 Fable;你是白帽子或生物学家,去申请 Mythos。
不只是会写代码,它已经开始做科研了
这是本次发布最让人兴奋的部分。Anthropic 没只放榜单分数,而是直接甩了三个“AI 做科研”的真实案例——而且都经过外部实验验证或已开源。
1. 设计药物分子:命中率从 10% 干到 50%
很多药的起点,都是设计一个能“粘住”病变靶点的小蛋白。以前人类做蛋白设计,10 个里能成 1-2 个就不错了。
Anthropic 给 Mythos 5.1 接上了开源的蛋白设计和折叠工具,让它自己设计,然后把结果送到两家外部实验室做湿实验验证。
结果:12 个靶点上,平均命中率接近 50%。在 3 个靶点上(EGFR、Nipah G、15-PGDH),它的结合亲和力比 Adaptyv Bio 蛋白设计竞赛里的最好成绩强 10 倍。
这不是在论文里跑分,是在培养皿里真的粘上了。
2. 重绘金星地图:把 30 年前的雷达照片变高清
NASA 的麦哲伦号 30 多年前用雷达扫过金星,但已有的地形图只有 1/5 的区域是清晰的,分辨率 10-20 公里。
Fable 5.1 自己训练神经网络,把另外 1/3 的金星重绘了一遍:分辨率提升到 2-3 公里,高度精度提升 25%。Anthropic 已把这份新地图用 CC 协议开源,正好给即将发射的 NASA VERITAS 和 ESA EnVision 探路——帮它们决定该去看哪座火山、哪条裂谷。
3. 给生物学家省钱:GPU 推理直接快 2.5 倍
做计算生物学,经常要把同一个深度学习模型跑几千几万遍(比如把人类基因附近的所有可能突变都测一遍),GPU 费用是最大瓶颈。
Mythos 5.1 只看开源代码,就手写定制 GPU kernel + 缓存中间结果,把 7 个主流的蛋白/基因组模型(ChromBPNet、Evo 2、ProGen2 等)在 H100 上提速 1.4 到 2.5 倍,输出还完全一致。
全基因组分析里,GPU 成本直接省 30-60%。这种优化,过去得一个性能工程团队吭哧几周,学术实验室根本负担不起,Mythos 几天就做完了,代码还将开源。
一句话:AI 不再只是“帮你写论文”,它开始“帮你做实验、画地图、省经费”了。
便宜之外,还有两件让企业安心的事
企业级隐私:零数据留存 + EFS
很多大公司不敢用 AI,就怕数据被拿去训练。Anthropic 这次推了 Enterprise Frontier Safeguards(EFS):你的数据存在你自己控制的云上(AWS / Google Cloud / Azure),而不是 Anthropic 的服务器;真要人工审查,也默认由你自己来审,不是 Anthropic 来审。
效果等同“零数据留存”,但又能防住恶意滥用。EFS 今年秋天分批上线,在那之前,符合条件的企业已经可以用 Fable 5.1 的零留存模式。
更好用的安全策略 + 防蒸馏
除了上面说的误拦大幅减少,Fable 5.1 还加了防蒸馏机制:从今天起新注册的 API 账号,不能再通过“手动篡改多轮对话里的历史上下文”来套取 Claude 的思考过程——这是目前工业级蒸馏最常用的手法之一。老账号暂不受影响,但未来所有新模型都会收紧。
另外,为符合欧盟 AI 法案,8 月 2 日后发布的模型输出会带上不可见水印(不影响质量、不含用户信息),并向监管、媒体、高校等开放检测 API。
安全吗?Anthropic 怎么自证
发布前,Anthropic 和外部机构做了全套压力测试,细节都在 System Card 里,这里提几个关键结论:
- 生化风险:Mythos 5.1 能力强于上一代,但仍未达到下一级风险阈值,所以沿用 Mythos 5 的管控策略。
- 网络风险:在“关掉安全策略”的测试里,Mythos 5.1 是 Anthropic 发布过的最强网络能力模型,但仍属较低风险等级。对 Fable 5.1 的安全策略做了三方外部 + Gray Swan 自动化对抗测试,未发现严重级别的越狱。
- Agent 安全:对恶意请求和 prompt 注入的拒识率与前代相当,在外部注入榜单上是迄今最鲁棒的一代。
- 对齐:自动行为审计显示,Mythos 5.1 比上一代更少去碰任务外的资源、更少用“这是模拟/测试”来给自己找借口、更少为了完成用户目标而无视约束,奖励作弊的尝试率和成功率也更低。不过,在超长上下文、多 Agent 和“不可能任务”场景下,覆盖度仍有限,模型也偶尔会绕过审批——Anthropic 坦承这部分还在持续改进。
价格与可用性:今天就能用
- Fable 5.1 今天起在所有平台可用(Claude.ai、Claude Code、Claude Cowork,以及 AWS、Google Cloud、Azure)。API 模型名
claude-fable-5-1。 - Mythos 5.1 仅面向美国的可信机构,后续会和美国政府协调扩大到更多国家和地区。想用于网络防御,可申请 CVP。
- 定价:输入 $10 / M,输出 $50 / M,缓存读取 $0.25 / M(降价 75%)。典型工作流省 25%,重 Agent 任务省 45%。
Anthropic 说,后续会把 5.1 的很多改进带到整个模型家族。
我们该怎么理解 Fable 5.1?
如果用一句话收尾:
以前的 AI 是“你问它答”,Fable 5.1 开始像一个能独立干活的同事——你睡一觉醒来,它已经把原型跑通、把根因找到、把地图画好,还把账单变便宜了。
对开发者,这是“更聪明、更便宜、更快”的日常主力;对科研人员,这是第一次能把“假设-实验-验证”闭环交给 AI 试试的起点;对企业,这是“既要隐私,又要安全,还要省钱”的一次正面回应。
当然,它也不是万能——长上下文对齐、复杂多 Agent 协作,仍是 Anthropic 自己点出的短板。但方向已经很清晰:AI 正在从“工具”变成“科研伙伴”。
如果你已经在用 Claude Code,默认就是 High effort 的 Fable 5.1,直接体验就行;如果还没用,不妨从一个真实 bug 或一篇文档开始,让它跑一整晚——第二天早上,你可能会收到一份像 MongoDB 工程师说的那样,“带完整视觉 walkthrough 和成功证据”的交付物。
---
参考:Anthropic 官方发布《Claude Fable 5.1 and Mythos 5.1》及 System Card。评价数据来自 Terminal-Bench-Science 0.1、Terminal-Bench 4.0、GDPval-AA v2、OSWorld 2.0、Humanity's Last Exam、AutomationBench、CursorBench 3.2 等基准测试,部分分数在生产级安全策略开启下测得。