今天凌晨,Anthropic正式发布了Claude Opus 5。这款模型在此前已经泄露了一路,如今正式亮相后迅速被开发者玩疯了。
定价方面,Opus 5与上一代Opus 4.8完全一致——每百万输入token 5美元、输出25美元。作为参照,Fable 5的定价是10美元和50美元。换句话说,Opus 5的价格正好是Fable 5的一半。
但真正让整个AI圈炸锅的,是它的性能数据。
多项评测反超Fable 5,差距“属于碾压级别”
先看编程能力。在Frontier-Bench v0.1评测中,Opus 5拿到了43.3%,Fable 5是33.7%。将近10个百分点的差距,在编程评测里属于碾压级别。作为对比,Opus 4.8在这个测试上只有21.1%,Opus 5直接翻了一倍多。
知识工作方面同样不弱。GDPval-AA知识工作评测中,Opus 5拿下1861分,Fable 5是1747分,GPT-5.6是1736分。
在ARC-AGI 3测试中,Opus 5的得分是第二名模型的三倍——而在此之前,最强AI模型的得分只有0.37%。
计算机操作方面,OSWorld 2.0基准测试中,Opus 5仅需略高于三分之一的成本,就超过了Fable 5的最佳成绩。
在CursorBench 3.2编程测试中,Opus 5在最高努力模式下的成绩,仅比Fable 5峰值低0.5%,但单项任务成本只有后者的一半。Cursor随后公布的榜单显示,Fable 5开到Max档跑出70.5%,每任务17.32美元;Opus 5同档70.0%,每任务8.23美元——落后半个百分点,价格不到一半,token用量还少了40%。更值得注意的是,Opus 5的Extra High档位全面超过Fable 5同档,每任务还便宜4美元。不开到顶配的话,便宜的反而是更强的那个。
网友实测:从“大错特错”到“差点从椅子上摔下来”
模型上线不过半天,网友们就开启了疯玩模式。
博主am.will原本觉得Opus 5不过是一个便宜版Fable,测完直接改口说自己“大错特错”。他只用了5倍Max订阅额度的27%,就让Opus 5搭出了他见过最好的一个游戏克隆版,代码还开源在了评论区。
博主OmedTheVibeCoder测完一个竞技场对决的画面后,评价从“以为会接近”变成“根本不是接近,是完全甩开了它”。后来他又放出了和其他模型的对比,并补充说自己“差点从椅子上摔下来”——因为Opus 5 Max直接打破了他原来的测试标准。他表示,这已经不像是代码生成的画面,倒像是把提示词丢进了图像生成器,出来的却是一整张能走进去的地图。
还有博主做了一个头对头对比——同一个3D场景,分别交给Opus 5和Fable 5生成。Fable 5虽然一次成型,但细节密度上肉眼可见地输了一截——帐篷是纯色平面,草地没有起伏,弹弓本体也少了参数面板。
Noema给Opus 5出了一个“狠”提示词:要求只用一个HTML文件,做出一整条从1945年变化到2055年的街区——建筑、车辆、店铺、人群、灯光和音效全部跟着年份走。即使思考档位从max降到high,Opus 5的结果也把Fable 5和GPT-5.6 Sol都甩在了后面。Noema给的评价只有三个单词:“是个怪物”。
CAD设计上,网友直接给它封神,表示它在很多机械设计任务中表现超越了Fable。
博主Chetaslua更是把一次Minecraft复刻生成称为“迄今为止最好的一次创作”。把它接入到Unity,就像给游戏开了挂一样。
官方怎么说?——产品线的重新排位
有趣的是,Anthropic在官方公告里的措辞极为精确:Opus 5只是“接近”Fable 5的能力。一个在大多数考场里分数更高的学生,被官方定性为“接近”那个分数更低的学生。
这其实不是话术失当,而是产品线的重新排位。
Anthropic的模型矩阵是按场景分的。Mythos 5是网络安全和高风险科研方向的专用模型,能力最锋利,开放范围也最窄。Fable 5面向最复杂、持续数天的自主任务,是保留给“最雄心勃勃工作”的旗舰。Opus 5则面向日常编程、知识工作和企业智能体,价格更低,适合高频使用。
ZDNET的评论一针见血:“Sonnet 5被卡在一个尴尬的位置:夹在更便宜但弱得多的Haiku 4.5,和更强但更贵的Opus与Fable之间。”而Opus 5发布后,整条产品线形成了一个完整的链条——Haiku、Sonnet、Opus、Fable、Mythos,每一级都卡在上一级和下一级之间。
那还需要Fable 5吗?
这个问题的答案取决于你的使用场景。
如果你需要处理最复杂、持续数天的自主任务,或者涉及进攻性网络利用和长周期自主生物研究等高风险场景,Fable 5和Mythos 5仍然是更强的选择。内部法律智能体评测中Fable领先,DeepSWE编程测试上Fable略高。
但如果你需要的是日常编程、知识工作、企业智能体——也就是绝大多数开发者和团队的实际需求——Opus 5以一半的价格提供了接近甚至超越旗舰的性能。正如一位网友的神评:“如果跟Fable 5差不多,那为什么还要花2倍的价格用Fable 5?”
目前,Opus 5已经成为Claude Max的默认模型,也是面向个人订阅用户可调用的最强模型;Fable 5则主要面向API与企业客户。
常见问题
-
Opus 5真的在所有测试中都超过了Fable 5吗?
并非全部。在Frontier-Bench编程评测、GDPval-AA知识工作评测、OSWorld 2.0计算机操作等多项测试中Opus 5确实超过了Fable 5。但在Humanity‘s Last Exam不用工具时,Opus 5得56.3%,略低于Fable 5的56.5%;DeepSWE编程测试上Fable也略高;在网络安全漏洞利用能力上,Opus 5被刻意留在Mythos 5之后。 -
Opus 5的“努力程度”档位是什么意思?
Opus 5提供了可调节的effort(思考档位),用户可按任务难度调整推理资源投入。档位越高,处理复杂问题的能力越强,但速度更慢、Token消耗也更多;调低则省时省钱。在High、Xhigh和Max三个推理等级上,Opus 5在同成本下的性能都超过了所有其他模型。 -
Opus 5的Fast模式是什么?
Fast模式运行速度约为默认速度的2.5倍,价格为基础价格的2倍。追求速度的用户可以开启这个模式。 -
Opus 5能替代Fable 5吗?
取决于使用场景。日常编程、知识工作和企业智能体场景下,Opus 5是更具性价比的选择。但对于最复杂、持续数天的自主任务,Fable 5仍然更强。
Opus 5的发布,本质上是在用一半的价格,把旗舰级的能力下放到了日常使用的区间。对于绝大多数开发者和团队来说,这可能才是真正用得起的“最强模型”。至于Fable 5——它依然站在顶端,只是顶端的价格,不再是你唯一的选择。