(来源:机器之心)
机器之心编辑部
刚刚,Anthropic 正式发布新一代模型 Claude Opus 5。
此时距离该公司与美国政府的最新一轮交锋刚过去数周,距离 OpenAI 引发全行业热议的安全事件也仅数日。
时机颇为微妙。
官方博客称,Claude Opus 5 是一款更具主动性、也更审慎的模型,其智能水平接近 Claude Fable 5,而价格却只有后者的一半。
在 Frontier-Bench、GDPval-AA 等编程与知识工作评测中,它刷新了行业最高纪录,仅在网络安全任务上落后于 Mythos 5。
它的运行效率高于其他模型,适合高频日常使用。目前它已成为 Claude Max 的默认模型,同时也是 Claude Pro 上最强的选择。
性能表现
与前代 Opus 4.8 相比,Opus 5 在成本不变的前提下大幅提升了性能。用户可通过「努力程度」(effort)设置自由权衡性能:调高可获得更强的智能,调低则更快、更省 token。
编程方面,在 Frontier-Bench v0.1 中,Opus 5 超越所有对手,得分达到 Opus 4.8 的两倍以上,单任务成本反而更低。
在 CursorBench 3.2 中,它在最高努力档位下与 Fable 5 的峰值成绩仅差 0.5%,成本只有一半;在 high、xhigh 和 max 三个档位上,同等成本下的表现均领先所有其他模型。
知识工作与问题解决方面,成绩同样亮眼。
ARC-AGI 3 考察模型解决全新问题的能力,Opus 5 的得分是第二名的三倍。
Zapier AutomationBench 衡量端到端完成商业任务的水平,它在相同单任务成本下的通过率约为次优模型的 1.5 倍;即便调到最低努力档位,通过的任务数也多于任何竞争者。
OSWorld 2.0 是一项计算机操作基准,Opus 5 在任意成本点上都胜过其他模型,并以约三分之一的成本超过了 Fable 5 的最佳成绩。
在多项相关评测中,它同样是最强且最具性价比的模型。
科研能力显著进步
Opus 5 在生命科学的每一项评测中都优于 Opus 4.8,覆盖结构生物学、有机化学和生物信息学等方向。
进步最明显的是有机化学:在根据波谱数据推断分子结构的内部基准上,它比前代高出 10.2 个百分点。在预测序列变异如何影响蛋白功能的评测中提升了 7.7 个百分点。
此外,它生成的可视化产出质量也大幅增强。比如,Opus 5 将空气流过空气动力学(和非空气动力学)物体的流动情况可视化,或者制作一个简化版的交互式细胞示意图。
更强的自主性与严谨性
Opus 5 更擅长核查自己的工作,并持续迭代直到成功。
在 Frontier-Bench 的一项任务中,模型需要根据一张机械零件图纸编写代码,用 FreeCAD 重建三维模型,却被刻意剥夺了直接查看图纸的途径。Opus 5 自行编写了计算机视觉流水线,从原始像素中提取几何信息,最终完整重建了零件,并能稳定复现这一结果。相同条件下,竞品模型尝试五次均告失败。
针对一款流行的开源软件包管理器中存在的真实漏洞,Opus 5 找到了根本原因,并修复了社区补丁遗漏的一个极端情况。而竞争对手的版本仅仅修复了表面症状(并未触及根本原因),然后就报告漏洞已解决。
一家交易公司的工程师使用 Opus 5 在一次会话中就为一家新交易所构建了市场数据源。之前的模型根本无法完成这项任务,即使工程师提供了详尽的计划。由于没有可供验证的实时数据源,Opus 5 甚至自行构建了测试框架,以检查其代码是否正确解析了交易所的数据。
对齐与安全:迄今最可靠的版本
Anthropic 称,部署前的自动化行为审计显示,Opus 5 是 Anthropic 迄今对齐程度最高的模型。它对 Claude 宪章的遵循度超过 Opus 4.8、Sonnet 5 和 Fable 5,欺骗行为发生率最低,也最难被诱导滥用。在避免可能造成难以逆转后果的鲁莽操作方面,它同样创下最佳纪录。
在自动化行为审计中,Opus 5 在整体不协调行为方面得分为 2.3,是 Anthropic 最近推出的模型中得分最低的。
在高风险的两用能力上,Opus 5 没有突破现有边界。
Anthropic 与私营部门及政府伙伴合作开展的严格评估表明,它在生物研究和进攻性网络安全两个方向都落后于 Mythos 5。
团队延续了对 Opus 4.8 的做法,刻意不针对网络任务训练该模型。随着通用能力增强,模型在这类任务上仍有可观进步,发现安全漏洞的水平已接近 Mythos 5,但把漏洞转化为实际网络威胁的能力差距依然很大。
OSS-Fuzz 评测印证了这一点:两个模型识别漏洞的成功率相近,可在开发利用程序的环节,Opus 5 的得分远远落后。
在 Anthropic 的网络安全评估之一 OSS-Fuzz 中,Opus 5 在识别软件漏洞方面与 Mythos 5 非常接近(左图),但在开发针对这些漏洞的攻击方面则远不如 Mythos 5 成功(右图)。
分级防护:兼顾安全与可用
Opus 5 的防护体系与 Opus 4.8 大体一致,仅在少数网络任务上加强了限制。
其网络安全分类器比 Fable 5 宽松,允许在源代码中查找漏洞,但会拦截二进制层面的漏洞扫描、渗透测试和利用程序生成,因为这些方法更常与恶意行为者相关。
据测试,分类器的干预频率预计比 Fable 5 低约 85%。在 Claude.ai、Claude Code 和 Claude Cowork 中,被拦截的请求默认回退至 Opus 4.8 处理,API 用户也可开启同样的回退机制。已加入网络验证计划(CVP)的企业和研究者可立即使用限制更少的版本。
生物方向的防护延续前代设计,这让 Opus 5 成为目前公开可用模型中科研能力最强的一款。不过它在长时程自主研究任务上仍有明显局限,而这恰是生物风险最集中的场景,Mythos 5 在此类工作上依然更强。本次发布后,在 Fable 5 上被拦截的生物类请求将改为路由至 Opus 5。
定价与新功能
Opus 5 即日起在所有平台上线,定价为每百万输入 token 5 美元、输出 25 美元,与前代持平,且只有 Fable 5 的一半,也略低于 OpenAI 的 GPT-5.6。
新推出的「极速模式」(Fast mode)以两倍价格提供约 2.5 倍的默认速度,目前处于研究预览阶段。用户还可选择开启自动回退:当安全分类器拦截 Opus 5 或 Fable 5 的请求时,系统会自动路由到其他可用模型,确保请求始终得到最佳模型的响应。
此外还有两项测试版更新:Claude 平台支持在对话中途更换工具而不使提示缓存失效;API 端支持上述自动回退功能。与此前的 Opus 系列一致,Opus 5 的通用访问不设数据保留要求。
参考链接:
https://www.anthropic.com/news/claude-opus-5
https://www.theverge.com/ai-artificial-intelligence/970105/claude-opus-5-announced-anthropic-ai-model-release