Gemini 4 Argon 发布:谷歌 7 个月后重回牌桌,1.99 美元的「骨折价」比跑分更吓人

谷歌终于在 7 个月后拿出了新一代前沿模型 Gemini 4 Argon,这是它这段时间以来首款非 Flash 级专有模型。被 GPT-6 和 Claude 5 压着的这段日子,谷歌这次把能掀的都掀了:文本竞技场排名第一、得分 1533 碾压 Opus 5.5,Artificial Analysis 智能指数 53 分直接追平 GPT-6 Astra。单看跑分,这算一次教科书级的「重回牌桌」;但真正让我这种干活的人眼皮一跳的,是它的定价和对内核的重写。

先说说价格。单任务成本 1.99 美元,只有 GPT-6 Astra 的 60%,被直接标在帕累托前沿上。百万输入 Token 2 美元、百万输出 Token 10 美元,缓存输入折扣打到丧心病狂的 95% off。放在「前沿顶级智力」这个档位里横向比一下:GPT-6.1 Sol 是 0.72 美元,Argon 1.99 美元,GPT-6 Astra 3.26 美元,Claude Opus 5.5 是 5.98 美元,Claude Fable 5.1 要到 7.63 美元。Argon 不是全场最便宜的,但它做到了和 Astra 智力基本持平、成本只有人家六成。这摆明了是拿 TPU 算力集群的体量优势打不对称价格战,逼 OpenAI 和 Anthropic 跟着放血。

输出上限拉到 1M Token

比起价格战,我更关心 Argon 把输出上限从以前的 64K 拉到了 100 万 Token。这个改动不如跑分那么炫,但对长程任务是真有体感的变化。以前模型做复杂推理经常「说到一半断气」,现在单次运行能生成几十万 Token,等于给了它足够的思考余量。用谷歌自己的话说,有了这个空间,模型能在单次推理里达到新的深度层次,一次性解决棘手问题。这直接反映在基准上:DeepSWE v1.1 真实长程软件工程拿了 77.9% 的 SOTA,Vals Index(金融、编程、法律综合经济价值)以 68.9% 列第一,AutomationBench 企业端到端执行 51.3% 头名,多模态长视频理解 91.7%,3D 理解的 Blueprint-Bench 2 也列第一。

当然,基准是基准,真正让我觉得这次「可能比大家以为的更重要」的,是谷歌内部拿它干的活。但要先说清楚一个前提:这些描述来自报道转述,没有全链路可核验的官方细节,我只能先按「据称」来读,方向倒是值得留神。

Argon 组成的智能体团队自主分析了谷歌全网海量性能分析遥测数据,抓住内存优化空间并自主提交修改建议,代码上线后释放了超 300 TiB 内存,后续预计总节省可达 500 TiB 到 1 PiB——在谷歌的体量下,背后是以千万美元计的电费和采购成本。更硬核的是它主导把底层 C/C++ 内核往内存安全的 Rust 迁移,AI 经手的代码规模已超 80 万行,包括 Fuchsia Zircon 内核。还有个最猛的例子:开源视频解码项目 libgav1 里 3.2 万行人类写起来都极痛苦的 SIMD 代码,Argon 用 Rust 重写后,速度比原 Rust 移植版快了 2.7 倍,性能持平高度优化的 C++ 版,输出画面每一帧都一样。

做过内核开发的都清楚,重构代码漏一个指针、内存分配错一处,系统当场就崩。让 AI 碰 80 万行内核,这确实是向 AI 下放自主权的一个里程碑。但材料里也承认,这些重构部署前经过了严格的自动化审计和人工审查;报道里同时提到,有能接触到内部评估的员工爆料,Argon 的编程能力「参差不齐」,处理前端设计时表现挣扎。所以「让 AI 写内核」和「AI 全面取代程序员」之间,还隔着一条很宽的沟。

网安版是「无护栏」的,不是人人都能用

另一个容易让人兴奋过头的是安全能力。Argon 在 CWE-bench v1(漏洞修复评估)上以 68% 并列第一,云安全公司 Wiz 已经在「Scan for Good」项目里接入它,早期演示中它挖出了全球多家医院医疗软件里的一个重大关键漏洞,连此前的几代前沿模型都漏掉了。正因为它这把双刃剑太锋利,谷歌走了「分层释放」:无护栏版只通过 Fairwind 计划给部分受信任的网络防御机构和谷歌内部团队,受限 API 版要参与美国政府的自愿发布前审查,公众版才后续推给付费 API 开发者和 Google AI Ultra 订阅用户。全面开放前谷歌甚至做了极端加固——高风险训练前把沙箱物理级密封隔离,实时监控思维链,发现试图偏离用户意图就立刻「拔网线」,而且明确这些监控数据不会反馈进训练集,防止模型学会伪装思维逃避监管。

我比较在意的一点是:目前能实际用上 Argon 的人群非常小。普通开发者短期内拿不到这个「无护栏」版本,所谓 1.99 美元的成本,是对能跑得起前沿任务的人说的,不是对所有人说的。

这背后是一个焦虑了半年的谷歌

这次发布也藏不住谷歌内部的狼狈。据彭博社报道,Argon 是「踩着尸体上位」:5 月 I/O 大会上承诺的 Gemini 3.5 Pro 夭折,单次训练成本据称高达 4 亿美元,加上顶级研究员的天价薪资,取消的代价惨痛。这几个月还流失了大量明星研究员,Jeff Dean 淡出,诺奖得主 John Jumper、核心发明人 Noam Shazeer 陆续离开。今年 8 月 Demis Hassabis 升任董事长,把 DeepMind 经营权交给副手 Koray Kavukcuoglu,后者上周还在稳住军心。AI 专家 Edwin Chen 也在提醒行业通病「Benchmaxxing」——刷榜综合症,工程师为让模型在基准上拿高分,疯狂让它适应特定语言代码题,却忽略了真正好用的应用。

所以 Argon 的发布没有打垮谁,它只是把谷歌重新拉回了牌桌,和 Google / OpenAI / Anthropic 两家交替领先。没有绝对霸主,只有一时领先,1.99 美元的价格屠刀确实在竞品基本盘上撕开了一道口子。至于报道里那位 DeepMind 研究员在 X 上疑似玩梗「RSI 来了,没什么可教它的,是时候去追逐我的咖啡师梦想了」随后秒删——这种消息我一向当段子看,不当事实,也建议别太认真。真正值得盯的,是那 80 万行内核代码后续怎么演,以及无护栏版本何时、以什么姿态走向更大的世界。RSI 这个词喊了一年多,这次至少有个模型在真实基础设施里干出了能省几千万美元的活,这比任何标题都更接近「自主权」的含义。

相关链接:

  • https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon(谷歌官方博客)