导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜
快讯 机构 观点 人物 专题

Claude Opus 5发布:多项基准超越旗舰Fable 5,API价格仅为其一半

Anthropic于今日正式发布Claude Opus 5,该模型在绝大多数基准测试中击败了此前被定位为日常前沿产品的Claude Fable 5,且API价格仅为后者的一半,成为企业用户更具性价比的新选择。

Opus 5的推出填补了Fable 5未能稳固占据的市场空间。Anthropic的产品线分为四个层级:Haiku(快速便宜)、Sonnet(中端)、Opus(重型主力)以及今年春季新增的Mythos级——该级别包括面向公众的Claude Fable 5,以及通过Project Glasswing项目向经审查的网络安全研究人员和关键基础设施运营商提供的限制更少的Claude Mythos 5。Fable 5自6月9日发布后命运多舛:上线三天后因美国政府以越狱漏洞为由发布紧急出口管制令而被全球下架,6月30日恢复后立即转为仅限积分使用模式,不再纳入标准订阅计划。Opus 5现在接替了Fable 5未能稳住的位置。

拥有数百万用户的开发者平台Lovable在内部评估中运行了Opus 5,其创始人Fabian Hedin通过Anthropic分享的声明指出:“Opus 5不仅在我们最难的智能体编码任务中比Opus 4.7提升了22%,而且运行更稳定,每次运行之间的方差显著降低。”

基准测试表现

听起来或许有些反常,但Opus在几乎所有对日常用户重要的指标上击败了Fable,同时并未像Fable那样被标注为Mythos级。

Claude Opus 5基准测试对比

在Frontier-Bench v0.1(测试AI编码智能体端到端完成实际软件工程任务,通过率评分)中,Opus 5达到43.3%,Fable 5为33.7%,OpenAI的GPT-5.6 Sol为34.4%。差距最大的是ARC-AGI-3(基于无法从训练数据中记忆的新奇谜题测试真正问题解决能力),Opus 5得分30.2%,GPT-5.6 Sol仅7.8%,Fable 5未参与测试。在GDPval-AA v2(基于Elo评级的知识工作基准)中,Opus 5达到1861,Fable 5为1747,GPT-5.6 Sol为1736。

Zapier在AutomationBench上测试了Opus 5,该评估考察模型能否在无需人工干预的情况下完整执行商业工作流。Zapier的评价是:该模型“接手一个原始客户健康工作表,端到端运行了完整的流失预防流程:标记风险账户、提醒相关负责人、并为留存运营生成摘要。之前的模型未能通过,Opus 5达到100%。”Anthropic还将Opus 5定位为研究升级。DNA测序公司Ultima Genomics表示,该模型“比我们运行过的任何模型都更像一位严谨的科学家。它知道选择正确的统计检验来排除混杂因素,采用独立方法交叉验证自身结果,并在漫长的多步骤分析中保持专注。”

不过,法律和健康这两个领域是Fable 5以微弱优势领先的唯一领域。

此次发布恰逢北京初创公司Moonshot AI(阿里巴巴支持)一周前推出Kimi K3——一个2.8万亿参数的开源权重模型(任何人都可下载底层代码独立运行),Moonshot称其为全球最大的开放AI系统。独立基准测试显示Kimi K3整体排名第三,落后于Fable 5和GPT-5.6 Sol,但在特定领域击败了这两个模型。

Opus 5现可通过API使用,价格如下:输入每百万token 5美元,输出每百万token 25美元。快速模式(约默认速度的2.5倍)价格为基准价格的两倍:输入每百万token 10美元,输出每百万token 50美元。该模型也面向所有用户提供订阅方式。