Anthropic 发布 Claude Sonnet 5:面向智能体场景的 Sonnet 系列重大升级

核心事件

2026 年 6 月 30 日,Anthropic 正式发布 Claude Sonnet 5。该模型定位为"最具智能体能力的 Sonnet 系列模型",在推理、工具使用、编码和知识工作等关键智能体性能方面较前代 Sonnet 4.6 实现了显著提升,性能表现已接近 Opus 4.8,但价格更低。


技术定位与能力突破

Claude Sonnet 5 的核心设计理念是降低智能体 AI 的使用门槛。Anthropic 指出,许多开发者的"智能体 AI 时代"始于 Sonnet 级模型——Claude Sonnet 3.5、3.6 和 3.7 是最早展现出色编码和工具使用能力的模型。然而近期智能体能力的最明显提升主要集中在 Opus 级模型中。Sonnet 5 的目标正是缩小这一差距。

具体而言,该模型具备以下能力:
- 自主规划:能够制定执行计划
- 工具调用:可使用浏览器、终端等工具
- 自主运行:在数月之前,这些能力通常需要更大、更昂贵的模型才能支持

根据官方提供的基准测试数据(对比 Sonnet 4.6 和 Opus 4.8),Sonnet 5 在多项评估中表现优于前代,并在部分任务上可匹敌 Opus 4.8 的性能水平。


定价与可用性

价格方案

阶段 输入价格 输出价格 有效期
首发优惠 $2 / 百万 token $10 / 百万 token 至 2026 年 8 月 31 日
标准价格 $3 / 百万 token $15 / 百万 token 2026 年 8 月 31 日后

作为对比,Opus 4.8 的标准价格为 $5 / 百万 token 输入、$25 / 百万 token 输出。

Anthropic 在脚注中说明,Sonnet 5 采用了更新的分词器(tokenizer),对相同内容的输入可能产生约 1.0–1.35 倍的 token 数量增加。首发定价的设计目标是使迁移到 Sonnet 5 的成本大致保持中性。

可用渠道

  • 所有订阅层级:Free 计划和 Pro 计划的默认模型;Max、Team 和 Enterprise 用户也可使用
  • Claude Code:集成于开发工具
  • Claude API:开发者可通过 claude-sonnet-5 模型 ID 在 Claude Platform 上调用
  • 速率限制调整:Anthropic 已提高 Chat、Cowork、Claude Code 和 Claude Platform 各使用层级的速率限制,以适配更高 effort 级别带来的 token 用量增加

成本效益分析

Anthropic 提供了在不同 effort 级别下的性能对比图表。数据显示,Sonnet 5(橙色线)相比 Sonnet 4.6(灰色线)在 agentic search 评估 BrowseComp 和 computer use 评估 OSWorld-Verified 上均为严格改进,且提供了比 Opus 4.8(黄色线)更广泛的成本-性能选择空间。

关键发现:
- 在中 effort 级别下提供显著改善的成本效率
- 在高 effort 级别下,部分任务的性能可与 Opus 4.8 匹敌
- 用户可在 Sonnet 5 和 Opus 4.8 之间通过调整 effort 级别找到成本与性能的最佳平衡点


安全评估

总体安全表现

Anthropic 的预部署安全评估显示:
- Sonnet 5 整体表现出比 Sonnet 4.6 更低的不当行为率
- 在智能体环境中使用时更安全
- 拒绝恶意请求和抵抗提示注入攻击的能力更强
- 幻觉(hallucination)和阿谀奉承(sycophancy)率低于 Sonnet 4.6

网络安全能力

值得注意的是,Sonnet 5 在网络安全相关任务上的能力显著低于 Opus 4.8 和 Claude Mythos Preview:

  • Anthropic 未针对网络安全任务对 Sonnet 5 进行专门训练
  • 在针对 Firefox 147 软件漏洞的开发 exploit 评估中(与 Mozilla 合作开发),两个 Sonnet 模型均未能成功开发完整可用的 exploit(得分 0.0%)
  • Sonnet 5 的部分成功率略高于 Sonnet 4.6,Anthropic 认为这很可能源于通用智能的提升而非特定训练

基于此,Anthropic 为 Sonnet 5 默认启用了网络安全防护机制(cyber safeguards),这些防护与 Claude Opus 4.7 和 4.8 中的防护相同。由于判断 Sonnet 5 的整体网络安全风险较低,防护严格程度低于 Fable 5 所采用的防护。

完整的评估结果详见 Claude Sonnet 5 System Card


早期合作伙伴反馈

Anthropic 分享了多家早期访问合作伙伴的使用反馈:

  • Sweep:Sonnet 5 为多步软件工程工作提供了强大的执行层,擅长处理持续编码、工具使用和调试
  • Salesforce 相关客户:端到端完成两部分任务(更新 Salesforce 账户层级 + 向企业联系人发送发布公告),而此前会中途停滞
  • Lovable:输出质量不变但所需步骤更少,且能一致地拒绝不安全请求
  • Vercel:在处理最具挑战性的真实 pull request 时,能独立将每个任务推进到经过测试验证的结果
  • Cursor:在调查 bug 时,自发编写复现测试、实施修复,并暂存以确认 bug 在无修改时重现——全部在一次传递中完成
  • Eve(法律科技公司):在法律研究和分析方面获得最清晰的提升,迁移决策因性价比优势变得容易
  • ClickHouse:推理步骤更紧凑,让用户更快获得答案
  • Pace(保险行业):计算机使用智能体在保险工作流中 consistently 采取正确行动并快速完成
  • Kiro:提供与 Opus 级模型相媲美的顶级准确率,相较 Sonnet 4.6 实现明显的阶梯式改进

版本更正说明

Anthropic 在 2026 年 6 月 30 日的编辑说明中更正了两项基准分数:

  1. Humanity's Last Exam:更新了评分器模型,Sonnet 4.6 分数更新为 34.6%(无工具)和 46.8%(有工具)
  2. OSWorld-Verified:更改了评估运行方式以更准确反映真实世界表现,Sonnet 4.6 分数更新为 78.5%

这也是为何部分图表中 Sonnet 4.6 的分数与之前发布博客中报告的数据不一致。


总结

Claude Sonnet 5 的发布标志着 Anthropic 在"让智能体 AI 更普及"方向上的重要一步。通过在中端模型上实现接近旗舰模型的性能表现,同时保持更具竞争力的价格,Sonnet 5 为需要大规模部署智能体应用的开发者和企业提供了一个高性价比的选择。对于关注成本效益与智能体能力平衡的从业者而言,Sonnet 5 值得纳入技术选型考量范围。