Anthropic发布Claude Opus 5:性能超越Fable 5,价格减半

Anthropic发布Claude Opus 5:性能超越Fable 5,价格减半

核心事件

Anthropic于今日凌晨正式发布Claude Opus 5。该模型在多项评估中表现优异,尤其在软件工程、复杂任务处理和专业知识工作方面显著提升。

性能突破

  • 综合性能:在多数评估中超越Fable 5,能力接近更高一级的Fable 5,但价格仅为其一半。
  • 软件工程基准:在Frontier-Bench上超过所有其他模型,成绩较Opus 4.8翻倍,且成本更低。
  • 代码审查:显著提升代码审查准确度,能在保持高召回率的同时控制误报。
  • 电脑操作:在OSWorld基准测试中击败Fable 5,成本仅为后者的三分之一多一点。
  • 推理能力:在"人类最后的考试"中以64.7%得分排名第一,略高于Claude Mythos 5的64.5%;在ARC-AGI 3上得分是第二名(GPT-5.6 Sol (Max),7.8%)的三倍。
  • 科学研究:在内部生命科学评测中全面超越Opus 4.8,包括:
  • 根据光谱数据推断有机分子结构提升10.2个百分点
  • 根据蛋白质序列变异预测功能变化提升7.7个百分点
  • ArxivMath 2026年6月题集无工具90.8%,有工具91.3%

新特性

  • Fast Mode:新增快速模式,速度提升2.5倍,价格翻倍。
  • Thoughtful & Proactive
  • "深思熟虑":不仅多思考几步,还会检查假设、寻找根因、验证结果并迭代。
  • "主动":在缺少验证条件时,可主动搭建验证框架(如从图片原始像素提取几何信息完成零件重建)。
  • 长上下文:默认支持100万token上下文,在指令遵循、工具调用和推理一致性方面有提升。
  • 多Agent协作:更擅长writer-verifier分工、独立问题分配、路径汇总及减少重复工作。
  • 安全性:提示注入攻击成功率降至约0。

定价

  • 标准API:每百万输入token 5美元,输出token 25美元(与Opus 4.8相同,为Fable 5的一半)。
  • Fast Mode:速度约为默认模式2.5倍,价格为基础价格两倍。
  • Adaptive Thinking:默认开启,可在high及以下关闭。

测试功能

  1. 动态工具管理:允许在对话中途增加、删除或替换Claude可用工具,且不使prompt cache失效。
  2. 安全路由:触发安全分类器后,服务器可自动将请求路由至替代模型(需开发者记录响应来源)。

使用体验变化

  • 默认回答更长
  • Agent工作时更倾向汇报下一步计划
  • 写入文件的报告和文档更长
  • 更主动扩大任务范围
  • 更频繁自行验证
  • 更爱使用子Agent
  • 更常向用户通报修正过程

可用性

模型已正式开放,Max订阅用户可使用,Pro用户暂未开放。能力数据主要来自Anthropic及早期合作方评测,实际效果需更多外部验证。

参考文献
[1] https://www.anthropic.com/news/claude-opus-5
[2] https://x.com/claudeai/status/2080699495453528290
[3] https://www.anthropic.com/claude-opus-5-system-card
[4] https://platform.claude.com/docs/en/about-claude/models/