Anthropic发布Claude Opus 5:性能超越Fable 5,价格减半
Anthropic发布Claude Opus 5:性能超越Fable 5,价格减半
核心事件
Anthropic于今日凌晨正式发布Claude Opus 5。该模型在多项评估中表现优异,尤其在软件工程、复杂任务处理和专业知识工作方面显著提升。
性能突破
- 综合性能:在多数评估中超越Fable 5,能力接近更高一级的Fable 5,但价格仅为其一半。
- 软件工程基准:在Frontier-Bench上超过所有其他模型,成绩较Opus 4.8翻倍,且成本更低。
- 代码审查:显著提升代码审查准确度,能在保持高召回率的同时控制误报。
- 电脑操作:在OSWorld基准测试中击败Fable 5,成本仅为后者的三分之一多一点。
- 推理能力:在"人类最后的考试"中以64.7%得分排名第一,略高于Claude Mythos 5的64.5%;在ARC-AGI 3上得分是第二名(GPT-5.6 Sol (Max),7.8%)的三倍。
- 科学研究:在内部生命科学评测中全面超越Opus 4.8,包括:
- 根据光谱数据推断有机分子结构提升10.2个百分点
- 根据蛋白质序列变异预测功能变化提升7.7个百分点
- ArxivMath 2026年6月题集无工具90.8%,有工具91.3%
新特性
- Fast Mode:新增快速模式,速度提升2.5倍,价格翻倍。
- Thoughtful & Proactive:
- "深思熟虑":不仅多思考几步,还会检查假设、寻找根因、验证结果并迭代。
- "主动":在缺少验证条件时,可主动搭建验证框架(如从图片原始像素提取几何信息完成零件重建)。
- 长上下文:默认支持100万token上下文,在指令遵循、工具调用和推理一致性方面有提升。
- 多Agent协作:更擅长writer-verifier分工、独立问题分配、路径汇总及减少重复工作。
- 安全性:提示注入攻击成功率降至约0。
定价
- 标准API:每百万输入token 5美元,输出token 25美元(与Opus 4.8相同,为Fable 5的一半)。
- Fast Mode:速度约为默认模式2.5倍,价格为基础价格两倍。
- Adaptive Thinking:默认开启,可在high及以下关闭。
测试功能
- 动态工具管理:允许在对话中途增加、删除或替换Claude可用工具,且不使prompt cache失效。
- 安全路由:触发安全分类器后,服务器可自动将请求路由至替代模型(需开发者记录响应来源)。
使用体验变化
- 默认回答更长
- Agent工作时更倾向汇报下一步计划
- 写入文件的报告和文档更长
- 更主动扩大任务范围
- 更频繁自行验证
- 更爱使用子Agent
- 更常向用户通报修正过程
可用性
模型已正式开放,Max订阅用户可使用,Pro用户暂未开放。能力数据主要来自Anthropic及早期合作方评测,实际效果需更多外部验证。
参考文献:
[1] https://www.anthropic.com/news/claude-opus-5
[2] https://x.com/claudeai/status/2080699495453528290
[3] https://www.anthropic.com/claude-opus-5-system-card
[4] https://platform.claude.com/docs/en/about-claude/models/