Opus 5暂缓发布:3D能力惊艳,Token消耗成致命短板
近日,AI界传来一则令人唏嘘的消息:Anthropic原定于近期发布的旗舰模型Opus 5(代号Honeycomb/蜂巢)宣布暂缓发布。这一决定源于内部对模型安全性及Scaling Law可持续性的担忧。此前,部分开发者已通过路由机制提前实测该模型,其3D生成能力获得高度评价,但极高的Token消耗和基础视觉识别缺陷引发争议。
一、发布暂缓:安全与 Scaling Law 的质疑
据消息灵通人士透露,Anthropic决定暂缓Opus 5的发布,原因是该模型可能对人类控制高级AI构成威胁。一位内部人士称,这是首个让实验室开始质疑「Scaling Law是否该继续」的模型。
这一解释在网络上引发强烈反响。许多网友批评Anthropic采用「饥饿营销」策略,认为其以「安全威胁论」包装产品跳票的行为已失去公众信任。有评论指出:「这种制造恐慌的行为真烦人,赶紧停下来吧。」
二、提前实测:3D细节「封神」
尽管官方未正式发布,但部分拥有特殊权限的开发者已通过某些方法提前体验Opus 5。传言称,部分Opus 4.8的请求被自动路由到了Opus 5。
知名大V Chetaslua 发布了多个Demo,对Opus 5的3D生成能力给予极高评价:
- 天气UI卡片:Opus 5一次性生成了极其复杂的天气UI卡片,精细程度令人印象深刻。
- 游戏场景:生成的游戏画面被Chetaslua形容为「这辈子从未一次性见过如此精细的细节」。
- 3D家居模型:其空间理解、三维细节构建能力被评论为「这就是AGI」。
这些表现证明了Anthropic在底层逻辑推理和代码生成能力上取得重大突破。
参考资料:
- X Post by chetaslua
- X Post by clawdreyai
三、致命缺陷:Token 消耗与视觉翻车
然而,Opus 5的能力获取代价高昂。Chetaslua透露,仅三次对话便用光所有额度,其Token消耗量甚至超过Fable 5。
此外,Opus 5在基础视觉识别测试中遭遇失败。6月23日的测试显示,Opus 5未能识别出图片中松饼上的小虫子,而谷歌的模型可以轻松解决此任务。这一结果引发了关于模型「严重偏科」的讨论。
四、代号「蜂巢」:原本的王牌计划
Opus 5的代号为「Honeycomb(蜂巢)」,原计划带来以下跨越式提升:
- 超强记忆力:支持高达 100万 Token 的超长上下文窗口。
- 可配置的推理努力值:用户可在「速度」和「质量」之间动态调整。
- 全能进化:在写代码、AI智能体、工具使用和多步推理方面大幅强化。
- 智能安全与回退机制:提供生产工作流的安全防护。
独立开发者Pankaj Kumar爆料称,Opus 5的能力将无限逼近顶级Fable 5,但价格减半,成为开发者的「超级平替」。
早在7月9日,Chetaslua在Cursor IDE的模型选择器中发现「Claude Honeycomb EAP」选项,其描述包括:Anthropic研究模型、支持逐轮安全控制和安全回退、100万上下文窗口、超高推理强度。该选项在仅处理两个提示词后被撤下。
反向安全回落机制
「蜂巢」架构设计了一个独特的反向安全回落机制:当模型遇到复杂问题且自身置信度不足时,不会强行生成答案,而是触发回落机制,自动降级调用Opus 4.8兜底。这种设计平衡了算力成本与输出稳定性。
五、市场竞争背景
Anthropic急于推出Opus 5的背景是激烈的市场竞争:
- OpenAI步步紧逼
- Tibo(Anthropic CEO)频繁重置额度吸引开发者
- Kimi、Qwen、GLM等模型稳扎稳打,争夺全球开发者心智
代号「蜂巢」的Opus 5原本承载着用顶级推理能力打下高昂算力门槛、以100万上下文和3D生成能力展示「前沿模型」形象的任务。然而,暂缓发布的决定留给Anthropic的时间已不多。
总结
Opus 5的暂缓发布反映了AI开发中性能突破与安全可控之间的张力。其实测表现显示出在3D生成和逻辑推理上的显著优势,但Token消耗过高和基础视觉识别缺陷仍是亟待解决的问题。对于AI从业者和开发者而言,这一事件也提出了关于Scaling Law可持续性和模型商业化路径的深层思考。