Claude Opus 5发布:性能媲美旗舰,价格直降50%

Anthropic于7月24日推出新一代语言模型Claude Opus 5。该产品被定位为兼具高智能与低成本的通用解决方案,专为开发者及企业客户设计,其能力接近当前顶级模型Fable 5,但定价仅为其一半。

性能跃升,成本大幅降低

Opus 5距离上一版本Opus 4.8发布仅两个月,标志着Anthropic在模型迭代速度上的显著提升。尽管运行开销维持不变,其综合性能已实现跨越式增长,尤其在编程任务中展现出卓越效率。

多维度基准测试全面领先

在Frontier-Bench v0.1评测中,Opus 5击败所有竞争对手,每项任务所需成本更低,且性能较Opus 4.8提升逾两倍。用户可通过调节“努力程度”参数,在智能水平与token消耗之间灵活权衡,兼顾响应速度与经济性。

在CursorBench 3.2编程测试中,最大努力模式下得分与Fable 5最佳表现差距不足0.5个百分点,而单位任务成本仅为后者的一半。更令人瞩目的是,该模型在多个公开基准中直接超越了Fable 5的表现。

ARC-AGI 3新颖问题测试中,其准确率是第二名的三倍;Zapier AutomationBench测试中通过率约为最强对手的1.5倍,成本相当;在OSWorld 2.0计算机操作评估中,仅用三分之一成本便达成优于Fable 5最佳结果的成绩。

尽管整体表现强劲,Anthropic承认其在网络安全场景下仍略逊于Mythos 5。

安全机制优化与自动回退功能上线

Opus 5不再受制于Fable与Mythos系列所采用的30天数据保留策略,预计安全分类器触发频率将下降85%。然而,对于敏感操作仍设有防护边界:无法分析编译后的二进制文件漏洞,但可扫描源代码,因后者被视为更具可控性的分析层面。

为改善用户体验,Anthropic正在测试名为“自动回退”的新功能。当模型触发安全拦截时,系统将自动将其请求转至较弱但稳定的替代模型,确保用户获得有效输出,而非空值或错误提示。

典型案例显示其自主解决问题的能力:在一项要求将机械图纸重建为FreeCAD 3D模型的任务中,由于无法直接读取图像,Opus 5自行编写计算机视觉代码,从像素数据中提取几何信息并成功完成建模——这一过程其他模型在五次尝试后仍未成功。

Devin CEO Scott Wu表示,该模型在公司内部的FrontierCode 1.1测试中“以半价实现了接近Fable的性能”。Zapier CEO Wade Foster称,Opus 5已登顶其AutomationBench榜单,并在端到端流失预防工作流中实现100%通过率,此前所有旧版模型均未能完成该任务。在生命科学领域,其从光谱数据推断分子结构的能力相较Opus 4.8提升了10.2个百分点。

目前,Mythos 5、Fable 5与Sonnet 5均已在今年6月发布,仅有Haiku仍停留在前代版本。据披露,该公司于2025年11月估值达约3500亿美元,其中约80%收入来自超过30万家企业客户。