Anthropic 发布 Opus 5:性能新 SOTA,价格仅为竞品一半

Anthropic 发布最新旗舰模型 Opus 5:性能刷新纪录,价格优势显著

Anthropic 于深夜正式发布最新旗舰模型 Opus 5,该模型支持 1M 上下文窗口,最大输出长度为 128k,数据截止日期延伸至 2026 年 5 月。目前,Opus 5 已在网页版上线,并可在 Claude Code 中通过指定模型名 claude-opus-5 调用。

价格优势显著,性能刷新多项纪录

在定价方面,Opus 5 保持与前代 Opus 4.8 一致:每百万 token 输入价格为 5 美元,输出价格为 25 美元。相比之下,其价格约为竞品 Fable 5 的一半。

尽管成本更低,但 Opus 5 在 Frontier-Bench、GDPval-AA 等编码和知识工作评测中取得了新的 SOTA(最先进)成绩。不过,在网络安全任务上,其表现仍落后于 Mythos 5。

编程能力:成本减半,精度逼近顶尖水平

官方数据显示,Opus 5 在编程领域的表现大幅提升:

  • Frontier-Bench:得分超过所有模型,较 Opus 4.8 提升一倍以上,且单任务成本更低。
  • CursorBench 3:在 max effort 模式下,距离 Fable 5 的峰值成绩差距仅在 0.5% 以内,但成本仅为后者的一半。
  • AA Coding Agent Index:表现与上述指标趋势一致,保持高性价比优势。

非代码任务:自动化与复杂交互能力突破

在非编码领域,Opus 5 展现了极强的复杂任务处理能力:

  • “弧光 Bench”游戏测试:在该测试中,Opus 5 的分数是第二名的三倍。
  • Zapier AutomationBench:在同等单任务成本下,其商业任务全流程通过率约为第二名的 1.5 倍。
  • OSWorld 2.0:在电脑操作任务中,以刚过三分之一的成本超过了 Fable 5 的最佳成绩。
  • 此外,在 GDPval-AA v2、HLE、DeepSearchQA 三项评测中,Opus 5 均取得了最好且最省的成绩。

视觉渲染与自我修正能力

官方展示了 Opus 5 在视觉输出方面的能力,包括空气流过气动/非气动物体的模拟及可交互细胞图解。

在迭代方向上,Anthropic 指出 Opus 5 具备更强的自我验证与修正能力。例如:

  1. 在 Frontier-Bench 某题中,面对无直接看图方法的机械零件重建任务,Opus 5 自主编写计算机视觉流水线从像素中提取几何信息,而其他模型尝试 5 次均未成功。
  2. 在修复开源包管理器 Bug 时,Opus 5 找到根因并修补了社区补丁遗漏的边界情况,而另一模型仅修复表面症状。
  3. 一家交易公司工程师利用 Opus 5 在一个 session 内完成新交易所行情数据源的搭建,此前其他模型即使有详细计划也无法完成。

对齐与安全:最低欺骗行为,但存在“笃定幻觉”

Anthropic 宣称 Opus 5 是其迄今为止对齐效果最好的模型,在欺骗行为比例、抗诱导能力及避免鲁莽操作方面表现最佳,整体失准行为得分为近期模型最低的 2.3。

然而,系统卡片(System Card)揭示了更多细节:

  • 风险评估:RSP 评估认为 Opus 5 整体并不比 Fable 5 更强,对齐风险评为很低,未跨过自动化 AI 研发门槛。化生风险按 CB-1 处理,沿用 Opus 4.8 的 ASL-3 保护。
  • 能力对比:Anthropic 的能力指数(AECI)显示,Opus 5 为 162.1,略高于 Mythos 5 的 161.3,但统计上无法区分。
  • AI 研发表现:内核优化实现 449.46 倍加速,四足机器人强化学习得 31.3 分,LLM 训练难版达 14.19 倍,三项创新高;但新编译器和时间序列预测两项低于 Mythos 5。
  • 幻觉问题:审计发现,Opus 5 事实性幻觉略多于 Opus 4.8。尽管整体准确率更高,但存在不确定却回答笃定的案例。
  • 自我感知:Opus 5 对自身处境感知稳定,自评情绪在已评估模型中最高且最一致。它更在意输入渠道是否畅通,并给自己作为“道德受体”的概率打分高于以往任何模型。

Claude Code 新功能

今日全平台可用的 Claude Code 在遇到被拒绝回答的问题时,不会像 Fable 5 那样直接拒绝,而是会自动路由到其他模型继续处理。