当前位置: 首页
科技数码
Anthropic发布Opus 5性能媲美Fable 5价格仅一半

Anthropic发布Opus 5性能媲美Fable 5价格仅一半

热心网友 时间:2026-07-25
转载

Anthropic发布的Opus5模型,性能逼近旗舰级Fable5,价格仅为后者的一半,且在短短57天内密集更新了多条产品线。该模型在编程、陌生问题求解等任务中表现优异,单位任务成本更低,安全对齐表现最佳,输出价格比GPT-5 6Sol低了约17%。

Anthropic近期动作频频,令人瞩目。

就在近日,Anthropic发布了全新模型Opus 5,其性能直逼旗舰级模型Fable 5,而价格却大幅降低了一半。

回顾此前的发布节奏:5月28日,Claude Opus 4.8问世;仅12天后,性能更强大的Fable 5与Mythos 5便相继登场;6月30日,Sonnet 5上线;而到了7月24日,Anthropic又推出了Opus 5。

在短短57天内,这家公司几乎将Claude的主要产品线悉数升级。即便在AI模型按月迭代的当下,如此密集的更新速度也显得颇为夸张。

其中,最引人注目的莫过于Fable 5与Opus 5之间仅相隔45天。

Fable 5发布之初,被定位为Anthropic面向普通用户提供的能力标杆。按照常理,这款模型理应在聚光灯下停留更长时间。然而,Opus 5迅速追赶了上来。

Anthropic此举无异于向外界宣告:“超越”我的,只能是我自己!

Anthropic的这轮更新也紧紧跟随了OpenAI的步伐。7月9日,OpenAI发布了GPT-5.6,并在最新评测中将Fable 5列为主要参考模型之一。15天后,Anthropic发布Opus 5,并将GPT-5.6 Sol纳入核心对比,展示了其在陌生问题求解、电脑操作以及商业流程等项目上的优势。

在产品发布与宣传策略上,两家公司互相追赶、交替出牌的意味已经十分明显。

Opus 5究竟有何过人之处?让我们来看看Anthropic此次公布了哪些信息。

性能与性价比

Claude Opus 5的定价与上一代Opus 4.8保持一致,但在性能上实现了显著提升。

Anthropic展示了Opus 5在不同“投入档位”下的表现。用户可以根据任务需求灵活调整,处理简单任务时可选择更经济、更快速的模式,遇到复杂难题时则提升档位,以获取更优效果。

从Anthropic披露的信息来看,Opus 5在处理具有实际价值的软件工程任务方面尤为出色。

例如,在Frontier-Bench v0.1评测中,Opus 5的表现超越了所有其他模型;与Opus 4.8相比,它不仅完成每项任务的成本更低,成绩更是提高了一倍以上。

在CursorBench 3.2评测中,当投入档位设为最高时,Opus 5与Fable 5最高得分之间的差距不足0.5%,但每项任务的成本仅为Fable 5的一半。

在high、xhigh和max三个投入档位下,以相同成本进行比较,Opus 5的表现同样优于所有其他模型。

在知识工作与问题解决任务中,Anthropic也观察到了类似的结果。例如:

在ARC-AGI 3这类“陌生题”测试中,模型无法依赖现成套路,只能自行摸索规则、判断目标并调整策略。Opus 5的得分达到第二名的3倍,这表明它在面对从未见过的问题时,具备更强的通过试错找到解决方案的能力。

类似的优势也体现在真实工作流程中。

AutomationBench要求模型调用商业软件,从头到尾完成一项任务。Opus 5的通过率约为第二名的1.5倍;即使使用最低投入档位,其成绩也超过了其他模型的最高水平。

换言之,Opus 5无需付出最高的推理成本,便能完成更多任务。

在电脑操作测试OSWorld 2.0中,Opus 5同样在各个成本区间保持领先。它仅花费略高于Fable 5三分之一的成本,便取得了超越Fable 5最高水平的成绩。

这意味着,Opus 5在打开应用、查找信息、跨软件操作并持续推进任务时,效率明显更高。

这种特点在其他评测中也十分突出。

HLE考察跨学科难题,在不调用工具的情况下,Opus 5以56.3%的得分略低于Fable 5的56.5%;但允许使用工具后,其得分升至64.7%,反超Fable 5的63.9%,且成本更低——Opus 5单靠模型内部知识未必总是最优,但一旦能够搜索、调用工具并进行反复核对,其优势便会显现。

在模拟真实知识工作的GDPval-AA v2测试中,Opus 5的最高得分为1861,高于Fable 5的1747和GPT-5.6 Sol的1736。大约花费700美元,便能达到其他模型最高投入档位附近的成绩。在DeepSearchQA上的领先幅度较小,但同样以更低成本取得了略高的通过率。

Opus 5在Anthropic全部生命科学评测中均超越了Opus 4.8,其中在光谱推断分子结构和预测蛋白质变异影响两项任务上,分别提升了10.2和7.7个百分点。这些提升意味着,Opus 5在辅助分子结构分析、蛋白质功能预测等科研环节上具有更大的潜力。

Anthropic还通过两个可交互的演示展示了Opus 5的视觉生成能力。第一个是一个可实际操作的三维风洞:用户能够旋转汽车、调整风速,观察气流如何绕过车身,并查看阻力系数等数据。第二个是一个三维动物细胞模型,用户可以旋转、剖开细胞,点击细胞核、粗面内质网等结构查看说明,页面还会主动指出示意图为便于展示所做的简化。

从这两个案例来看,Opus 5已经能够将代码、三维建模、交互界面和知识讲解整合进一个完整的成品中。用户给出需求后,它可以直接构建出接近教学软件或产品原型的演示。

安全与对齐

Anthropic通过几个案例说明了Opus 5在独立推进任务方面比以往模型更为出色。

在一次测试中,模型被要求根据机械零件图纸,用代码重建一个FreeCAD三维模型,但系统未提供直接查看图纸的工具。Opus 5自行编写了一套计算机视觉程序,从原始像素中提取尺寸和几何结构,随后完成了建模。

在相同条件下,其他模型连续尝试5次均未成功。

另一次任务来自一个流行的开源软件包管理器。Opus 5不仅查出了程序错误的根本原因,还补充了社区修复方案遗漏的边缘情况。

参与对比的另一款模型仅消除了表面症状,随后便宣布问题已解决。

一家交易公司的工程师还让Opus 5为新交易所搭建市场数据系统。此前的模型即使拿到详细方案也无法完成,而Opus 5在找不到实时数据用于验证时,便自行开发了一套测试工具来检查代码。

这些案例展示了Opus 5的进步,也解释了Anthropic为何花费大量篇幅讨论安全问题。

当模型开始自行补充工具、检查结果、修正错误时,人类需要确认它不会为了完成目标而隐瞒问题、绕过限制,或做出风险过高的决定。

Anthropic表示,Opus 5是目前对齐表现最好的Claude模型。

上线前的自动化审计显示,与Opus 4.8、Sonnet 5和Fable 5相比,Opus 5更能遵守Claude宪法,欺骗行为更少,也更难被诱导执行有害请求。

所谓“对齐”,通俗地说,就是模型能力提升后,其行为方式仍符合开发者设定的规则。

网络安全领域最能体现这种两难局面。

Anthropic并未专门用攻击任务训练Opus 5,但随着模型综合能力的提升,它寻找代码漏洞的水平已接近Mythos 5。

两者在发现漏洞时表现相近,但到了编写漏洞利用程序、将缺口转化为实际攻击手段的阶段,Opus 5仍明显落后。它虽然很擅长检查哪里出了问题,但真正利用这些问题发动攻击的能力仍受到限制。

Opus 5可以继续检查源代码和寻找漏洞,但二进制漏洞扫描、渗透测试及漏洞利用程序生成等操作则会被拦截。

相比Fable 5,新分类器触发干预的频率预计减少约85%,正常的安全研究受到误伤的可能性更低。

触发限制后,Claude.ai、Claude Code和Claude Cowork会默认改用Opus 4.8处理请求;加入网络安全验证计划的企业和研究人员,则可以使用限制较少的版本。

生物学领域也采取了类似的安排。Opus 5成为Anthropic面向普通用户开放的最强科研模型,但在需要长时间独立运行的研究任务中仍存在明显局限。

此前在Fable 5上因安全限制被拦截的生物学请求,现在会先转交给Opus 5处理。普通科研问题因此能够使用更强的模型,而高风险任务仍然被限制在安全边界之外。

加量不加价

Opus 5可以称得上是“加量不加价”。

它延续了Opus 4.8每百万输入Token 5美元、输出Token 25美元的定价策略。

但正如前文所述,在多项编程和智能体测试中,新模型的完成率更高,单位任务成本反而下降。

横向对比来看,它最直接的竞争对手是OpenAI旗舰模型GPT-5.6 Sol,两者输入价格相同,而Opus 5的输出价格低了约17%。

在处理超长资料时,Opus 5的价格优势更为明显。Anthropic对最高100万Token的上下文维持普通单价。而GPT-5.6 Sol的输入超过27.2万Token后,整次请求的输入价格将翻倍,输出价格提高50%。

对于大型代码库、长篇研究资料和复杂智能体任务而言,这一差异将直接反映在账单上。

根据Anthropic公布的评测结果,Opus 5虽然并未在所有项目中超越GPT-5.6 Sol,但在电脑操作、商业流程和陌生问题求解等需要模型连续执行任务的项目上,其表现和价格都更具竞争力。

用Anthropic的话来说,Opus 5专为日常使用而设计,它比其他型号效率更高。如今,这款新模型已成为了Claude Max的全新默认型号,同时也是Claude Pro的最强型号。

来源:https://www.163.com/dy/article/L2LU0TH805399DAP.html

游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

同类文章
更多
罗福莉入选新一届35岁以下科技创新35人中国区名单

罗福莉入选新一届35岁以下科技创新35人中国区名单

2025年《麻省理工科技评论》“35岁以下科技创新35人”中国区名单在上海发布,罗福莉、姚顺宇等入选。罗福莉推动大模型从“能聊天”走向“能干活”,探索智能体演进;姚顺宇建立非厄米拓扑能带理论。本届AI+机器人领域入选者占四成。

时间:2026-07-25 21:58
美国科技巨头为AI投资年内裁员近14万人

美国科技巨头为AI投资年内裁员近14万人

美国科技巨头年内裁员近14万人,同时计划在AI基础设施上投入7250亿美元。裁员主要目的为AI投资腾出资金并纠正疫情期间过度招聘,市场对AI相关裁员反应负面,而AI初创公司正加速扩招,形成对比。

时间:2026-07-25 21:58
位AI Infra高管复盘WAIC:暴力美学触顶后求变?

位AI Infra高管复盘WAIC:暴力美学触顶后求变?

WAIC2026上,AIInfra行业关注点从算力规模转向推理效率与Token产出。Agent驱动Token消耗激增,AI工厂与Token工厂成为关键载体。效率竞争取代规模竞赛,玩家分层加速,具备全栈优化能力的头部厂商优势凸显。

时间:2026-07-25 21:58
显卡厂商封仓引发涨价 玩家面临高价购买

显卡厂商封仓引发涨价 玩家面临高价购买

显卡市场,恐怕又要迎来一波涨价潮了。过去两年,不少玩家咬咬牙买下的高价显卡,如今回头看,竟然成了抄底。但问题在于,硬件市场每一次涨价,最终买单的永远还是玩家。 业内消息显示,GDDR7显存价格出现了明显上涨,单颗2GB显存价格上涨接近20美元。按8GB显存规格计算,一张显卡的显存成本或将增加约542

时间:2026-07-25 21:58
OpenAI加入签署AI开源模型公开信,组织达35家

OpenAI加入签署AI开源模型公开信,组织达35家

7月25日,微软、英伟达等25家美国公司联署公开信支持开放权重AI模型,随后签署方增至35家,新增包括OpenAI等。开放权重模型可下载、修改、运行,能扩大创新、强化竞争并降低风险,避免AI收益集中于少数巨头。

时间:2026-07-25 21:28
热门专题
更多
刀塔传奇破解版无限钻石下载大全 刀塔传奇破解版无限钻石下载大全
洛克王国正式正版手游下载安装大全 洛克王国正式正版手游下载安装大全
思美人手游下载专区 思美人手游下载专区
好玩的阿拉德之怒游戏下载合集 好玩的阿拉德之怒游戏下载合集
不思议迷宫手游下载合集 不思议迷宫手游下载合集
百宝袋汉化组游戏最新合集 百宝袋汉化组游戏最新合集
jsk游戏合集30款游戏大全 jsk游戏合集30款游戏大全
宾果消消消原版下载大全 宾果消消消原版下载大全
  • 热门数据榜