Claude Opus 5发布:性能逼近Fable 5,价格减半,编程与科研能力大幅跃升
Claude Opus 5正式发布:兼顾“深思熟虑”与“主动响应”,性价比优势突出
7月25日,Anthropic正式发布了新一代旗舰大模型Claude Opus 5。该模型在性能上极为接近此前发布的高性能模型Claude Fable 5,但价格仅为后者的一半。这一发布迅速引发业界关注,网友评价称其为“端水大师”,既展示了新模型的强大实力,也为Fable 5和Mythos 5留足了面子。
一、性能与性价比:编程、推理与科研能力的全面跃升
Claude Opus 5专为日常高频使用设计,已成为Claude Max的新默认模型,同时也是Claude Pro中性能最强的模型。其定价为输入每百万Token 5美元/输出每百万Token 25美元,与Opus 4.8持平。开发者可通过API使用claude-opus-5,快速模式(Fast mode)运行速度约为默认速度的2.5倍,价格为基础价格的2倍。
该模型支持灵活的“思考程度/努力程度”(Effort)设置,用户可根据需求在极致智能与节省Token之间灵活调节。在多项权威评估中,Opus 5实现了显著突破:
- 编程与软件工程:在Frontier-Bench v0.1中,Opus 5超越所有其他模型,性能达到Opus 4.8的两倍以上;在CursorBench 3.2中,最高努力模式下其性能距离Fable 5的峰值得分仅相差0.5%,但单任务成本仅为后者的一半。
- 复杂问题解决:在ARC-AGI 3评估中,Opus 5得分是第二名模型的3倍;在Zapier AutomationBench中,相同单任务成本下通过率约为第二名模型的1.5倍。
- 科学研究:在生命科学领域(涵盖结构生物学、有机化学和生物信息学),Opus 5相比Opus 4.8表现显著提升。特别是在有机化学任务中得分高出10.2个百分点,蛋白质相关任务得分提升7.7个百分点。
- 视觉输出:Opus 5具备大幅增强的视觉输出生成能力,可生成空气动力学风洞风流图解和细胞结构互动图示等复杂内容。
二、自我校验与迭代能力:写代码前更爱“动脑子”
Opus 5在自我校验与审慎迭代方面能力提升显著,能够持续优化直至任务成功。这一特性在当前业内备受关注的模型“主动性”(Agency)与严谨性方面表现突出:
- 自主构建视觉管线:在Frontier-Bench的一项任务中,面对未提供直接查看图纸接口的限制,Opus 5自行编写计算机视觉处理管线,从原始像素中提取几何特征,成功重建3D机械零件,多次重复实验均告成功。而在相同设置下,其他竞争模型尝试5次无一成功。
- 根治深层Bug:面对一款热门开源包管理器中的真实Bug,Opus 5找到了根本原因并修复了社区补丁遗漏的边缘情况,而竞争模型仅修复表面症状。
- 自建测试套件:某交易公司工程师使用Opus 5在单次会话中为新交易所构建了市场数据接入源。由于缺乏实时数据源验证,Opus 5甚至自行构建了一套测试套件以检查代码准确性。
行业知名人士对Opus 5的评价也印证了其进步:
- Cognition CEO Scott Wu:Opus 5在Devin软件中困难问题的调试与根因分析任务中表现出色。
- Zapier CEO Wade Foster:Opus 5在未增加Token消耗的前提下拿下Zapier AutomationBench榜首,100%完成了客户流失预防流程。
- Lovable联合创始人Fabian Hedin:Claude Opus 5是Opus家族自4.5以来最大的一次飞跃。
- JetBrains IDE AI负责人Denis Shiryaev:Opus 5在写下代码前会更深入地思考,在规划阶段就能捕获自己的逻辑缺陷。
三、安全性与对齐:Anthropic迄今为止对齐程度最高的模型
在部署前的自动化行为审计中,Opus 5是其迄今为止对齐程度最高的模型。它比Opus 4.8、Sonnet 5或Fable 5更符合《Claude's Constitution》,欺骗行为发生率最低,且最不容易被误导或诱导滥用。在自动化行为审计中,Opus 5在整体非对齐行为上的得分为2.3,为近期模型中的最低值。
在网络安全方面,Anthropic特意避免在网络攻防任务上训练Opus 5,但由于通用能力的提升,该模型在寻找网络安全漏洞方面已逼近Mythos 5。在漏洞利用(将漏洞转化为实质性网络威胁)方面,它依然大幅落后于Mythos 5(OSS-Fuzz评估验证)。Opus 5的网络安全分类器限制相对Fable 5更加宽松,允许在源代码中查找漏洞,但会拦截“基于二进制”的漏洞扫描、渗透测试以及Exploits生成。针对被安全分类器标记的请求,系统默认会自动降级至Opus 4.8。
此外,Anthropic还更新了两个测试阶段功能:对话中途更换工具提示词缓存不失效,以及API自动降级处理以避免请求被直接拒绝。
四、结语:国内模型爆发倒逼海外厂商加码“性价比”
Claude Opus 5的发布体现了Anthropic在性能与性价比双重提升上的战略方向。在核心编程、复杂推理和知识工作中,Opus 5提升了显著,同时行业关注的自我校验迭代能力也有所增强。
当前,国内开源与闭源模型的“爆更”给海外大模型厂商带来显著压力,不少海外科技巨头逐渐转向中国模型。Anthropic此次强调Opus 5的性价比优势,或许预示着“性价比”将成为海外大模型厂商后续的重要策略之一。