OpenAI DevDay开幕前一天,Anthropic连夜把桌子掀了:Claude Sonnet 5.5正式发布,更快更便宜,还成了免费层默认模型。
说白了,这就像同一辆车的民用版突然跑出了赛道版的圈速,油钱还少了三成。你想啊,旗舰Opus负责撑门面,走量的Sonnet负责干活,现在干活的这个说自己也能干旗舰的活了,整个选型逻辑都得重算。
一句话结论:强在编码,赢在便宜
先把最重要的三组数摆出来,来自Artificial Analysis的实测和Anthropic官方口径,具体数字请回第三方原文核对。
AA智能指数56分,排第2,max effort下比Sonnet 5高出18分,只比Opus 5.5 max低2分。速度比Sonnet 5快30%以上,多数任务成本最多降低30%。定价没变:每百万输入2美元,输出10美元,缓存读取0.2美元。
TechCrunch转述的官方基准更扎眼:agentic编码上优于Opus 5.5,网络安全能力与Opus 5相当,成为首个适用与Fable、Opus相同网络安全防护的Sonnet模型。
这事有点离谱的地方在于,Sonnet一直是“性价比档”,现在它直接摸到了旗舰档的门把手。
为什么是现在:偷跑24小时,卡的就是DevDay
这事不是空降的。9月28日,Artificial Analysis先放出评测,开发者发现标识符claude-sonnet-5-5已经现身官方配置,并在Claude Code里开了灰度测试。
新智元当晚就跟了两条:性价比之王来了和偷跑实测碾压GPT-6 Sol直逼Astra。9月29日官方正式发布,AIHOT事件页一夜收录28篇报道。
时间点你细品:OpenAI要在9月29日开发者日推24小时在线助手“o”,Anthropic提前一晚甩王炸。这不是巧合,这是把对方发布会前夜的热搜先占了。
榜单细看:56分的代价是193k输出token
AA的56分不是白给的。原文提到一个关键细节:Sonnet 5.5逼近Opus 5.5,依赖的是约193k输出token的max effort模式。
翻译成人话:它不是一口答对,而是靠多想、多写、多试把分刷上去的。就像考试允许打草稿,它打了整整一本草稿纸。
所以选型时别只看56这个头衔,要看你的场景付不付得起这个草稿钱。好在官方这次把单价压住了:输入输出标价不变,速度还快了三成,多数任务整体便宜三成。对每天跑几千次Agent循环的团队,这就是每个月直接少付一张云账单。
另一头,Arena的Agent Arena给了真实任务视角:基于全球用户数百万长程任务,模型能用搜索、文件系统和终端干活。Sonnet 5.5已进榜开放投票,同场还有两个参照物:Opus 5.5 High排第2,净改进+12.15%,仅次于Fable 5.1 Max,成本比Opus 5 Max低56%;GPT-6 Luna Max排第23,净提升+1.6%,单任务成本仅0.05美元。一个主打能打,一个主打便宜,Sonnet 5.5卡在中间想全都要。
Terminal-Bench那边还有个小注脚:Sonnet 5.5拿到70.6%,价格不变。写代码、跑终端这种脏活累活,正是它要吃掉的市场。
落地在哪:Claude Code默认升级,免费用户先吃到
发布不是PPT,货已经铺出去了。
开发者侧,Claude Code v2.1.284把默认Sonnet模型切到5.5,支持1M上下文。同步上线Google Cloud、OpenRouter,Arena开了Agent Arena和Battle Mode评测。官方还附了开发使用指南,Conductor这类工具当天就宣布接入。
C端侧更直接:claude.ai免费层默认模型换成Sonnet 5.5。你不用付钱,不用改设置,打开就是新的。官方还预告Haiku 5.5几周后加入这个家族,到时候就是高中低三档全换血。
对你意味着什么?如果你在用Sonnet 5跑Agent,什么都不用改就能更快更便宜。如果你在Opus和Sonnet之间纠结预算,现在可以先拿Sonnet 5.5跑一遍你的真实任务,再决定要不要为剩下那2分付旗舰的钱。
怎么理解:中杯变大杯,旗舰守门
Anthropic这招其实很老道:不涨价,只加量。
Opus守住天花板和安全口碑,Sonnet把出货量最大的中间市场吃干抹净。编码反超Opus 5.5这个说法,说真的我没想到,但它恰恰点破了今年的趋势:模型分化不再是傻大个和小个子,而是谁能在有限token里把活干完。
结尾留个冷知识:Sonnet 5.5是Claude 5.5家族第二款模型,第一款是Opus 5.5。按这个节奏,Haiku 5.5来的时候,搞不好又是一次“小杯逼宫大杯”。到时候你再看今天这56分,可能只是个起点。