Anthropic 发布 Opus 5:性能新 SOTA,价格仅为竞品一半
Anthropic 发布最新旗舰模型 Opus 5:性能刷新纪录,价格优势显著
Anthropic 于深夜正式发布最新旗舰模型 Opus 5,该模型支持 1M 上下文窗口,最大输出长度为 128k,数据截止日期延伸至 2026 年 5 月。目前,Opus 5 已在网页版上线,并可在 Claude Code 中通过指定模型名 claude-opus-5 调用。
价格优势显著,性能刷新多项纪录
在定价方面,Opus 5 保持与前代 Opus 4.8 一致:每百万 token 输入价格为 5 美元,输出价格为 25 美元。相比之下,其价格约为竞品 Fable 5 的一半。
尽管成本更低,但 Opus 5 在 Frontier-Bench、GDPval-AA 等编码和知识工作评测中取得了新的 SOTA(最先进)成绩。不过,在网络安全任务上,其表现仍落后于 Mythos 5。
编程能力:成本减半,精度逼近顶尖水平
官方数据显示,Opus 5 在编程领域的表现大幅提升:
- Frontier-Bench:得分超过所有模型,较 Opus 4.8 提升一倍以上,且单任务成本更低。
- CursorBench 3:在 max effort 模式下,距离 Fable 5 的峰值成绩差距仅在 0.5% 以内,但成本仅为后者的一半。
- AA Coding Agent Index:表现与上述指标趋势一致,保持高性价比优势。
非代码任务:自动化与复杂交互能力突破
在非编码领域,Opus 5 展现了极强的复杂任务处理能力:
- “弧光 Bench”游戏测试:在该测试中,Opus 5 的分数是第二名的三倍。
- Zapier AutomationBench:在同等单任务成本下,其商业任务全流程通过率约为第二名的 1.5 倍。
- OSWorld 2.0:在电脑操作任务中,以刚过三分之一的成本超过了 Fable 5 的最佳成绩。
- 此外,在 GDPval-AA v2、HLE、DeepSearchQA 三项评测中,Opus 5 均取得了最好且最省的成绩。
视觉渲染与自我修正能力
官方展示了 Opus 5 在视觉输出方面的能力,包括空气流过气动/非气动物体的模拟及可交互细胞图解。
在迭代方向上,Anthropic 指出 Opus 5 具备更强的自我验证与修正能力。例如:
- 在 Frontier-Bench 某题中,面对无直接看图方法的机械零件重建任务,Opus 5 自主编写计算机视觉流水线从像素中提取几何信息,而其他模型尝试 5 次均未成功。
- 在修复开源包管理器 Bug 时,Opus 5 找到根因并修补了社区补丁遗漏的边界情况,而另一模型仅修复表面症状。
- 一家交易公司工程师利用 Opus 5 在一个 session 内完成新交易所行情数据源的搭建,此前其他模型即使有详细计划也无法完成。
对齐与安全:最低欺骗行为,但存在“笃定幻觉”
Anthropic 宣称 Opus 5 是其迄今为止对齐效果最好的模型,在欺骗行为比例、抗诱导能力及避免鲁莽操作方面表现最佳,整体失准行为得分为近期模型最低的 2.3。
然而,系统卡片(System Card)揭示了更多细节:
- 风险评估:RSP 评估认为 Opus 5 整体并不比 Fable 5 更强,对齐风险评为很低,未跨过自动化 AI 研发门槛。化生风险按 CB-1 处理,沿用 Opus 4.8 的 ASL-3 保护。
- 能力对比:Anthropic 的能力指数(AECI)显示,Opus 5 为 162.1,略高于 Mythos 5 的 161.3,但统计上无法区分。
- AI 研发表现:内核优化实现 449.46 倍加速,四足机器人强化学习得 31.3 分,LLM 训练难版达 14.19 倍,三项创新高;但新编译器和时间序列预测两项低于 Mythos 5。
- 幻觉问题:审计发现,Opus 5 事实性幻觉略多于 Opus 4.8。尽管整体准确率更高,但存在不确定却回答笃定的案例。
- 自我感知:Opus 5 对自身处境感知稳定,自评情绪在已评估模型中最高且最一致。它更在意输入渠道是否畅通,并给自己作为“道德受体”的概率打分高于以往任何模型。
Claude Code 新功能
今日全平台可用的 Claude Code 在遇到被拒绝回答的问题时,不会像 Fable 5 那样直接拒绝,而是会自动路由到其他模型继续处理。