谷歌杀回前三,但53分背后的账,得替开发者重算一遍
谷歌沉寂7个月,在10月1日凌晨掏出了Gemini 4 Argon,这是它这半年多来首款非Flash级的闭源模型。Artificial Analysis的智能指数里它拿到53分,追平GPT-6 Astra和Fable 5.1,比GPT-6.1 Sol高1分,幻觉率降到15%。同一个评测里,按首发折扣算,完成一个任务平均花1.99美元,是Astra的60%。分数追平、账单变薄,光看这两项,确实值得重新考虑该把活交给谁。
但把分数、报价和用量放在一起,最有意思的地方才出来。这模型算得便宜,却算得很费——打折结束,同样的任务甚至会比Astra更贵。
前三回来了,账得重新算
所谓沉寂7个月,有明确范围:Argon是谷歌超过7个月来第一款高于Flash级别的闭源模型,期间Flash产品一直在出。这次53分,比上一款非Flash模型Gemini 3.1 Pro Preview高23分,比Gemini 3.8 Flash高12分。AA据此判断,谷歌重回智能水平最高的3家实验室之列。
智能指数可以理解为一组能力测试的综合成绩,Argon用high推理档,Astra和Sol用max档。同分说明它们在这套评测里处于相近水平,具体工作还得分开看。Argon目前只向部分用户推送,尚未公开可用。
谷歌怎么吸引这些用户?报价很有诚意。每百万Token,Argon输入收2美元、输出收10美元,两项单价都是Opus 5.5的一半、Astra的1/5。反复用同一段材料,符合条件的输入还能享受95%的缓存折扣,首发期间每百万缓存输入Token只收0.10美元。
看起来相当划算。但可用模型的人付的是整张账单,单价只是其中一项。Argon平均每个任务输出6.2万Token,Astra只用2.7万。把推理过程比作打草稿,它的草稿纸要多写1倍多,每页便宜,架不住写得长。算到任务成本,Argon的1.99美元确实低于Astra的3.26美元、Opus 5.5的5.98美元和Fable 5.1的7.63美元,可Sol只要0.72美元,Argon约是它的2.7倍。
更影响长期选择的是,2美元和10美元属于首发5折促销,谷歌还没公布结束日期。恢复输入4美元、输出20美元的标准价后,按同一评测口径,单任务成本会变成3.98美元,约为Astra的1.2倍。这些数字还有一个共同前提:它们都是智能指数测试里的平均任务成本。让模型改代码、查材料,输入多长、输出多少、能用上多少缓存,都会改变账单,1.99美元不能当成所有工作的统一报价。打算长期接入的人,得拿自己的任务试算,把用量和折扣条件都算进去。
少说错话,也有代价
钱算清了,还得回答Argon好不好用。我最在意的是它处理「不知道」的方式。AA-Omniscience测试里,Argon的幻觉率15%,是智能指数45分以上模型中最低的,Astra为51%,Sol为54%。AA的解释是,Argon更愿意承认不知道,减少猜错后仍然硬给答案的情况。这对用户很有吸引力——碰到不熟悉的问题,回答越流畅,核对起来越容易掉以轻心,模型肯停下来承认能力有限,至少让人知道哪里还得查证。
不过,少编答案和多答对题,是两件事。Argon这项测试的准确率是50%,比Astra的63%低13个百分点,甚至比Gemini 3.1 Pro Preview低5个百分点,综合分42接近Astra的43、与Sol相同。你可以欣赏它的克制,同时承认它答对的问题没有Astra多。15%的幻觉率也仅属于这项测试,不能直接当成所有日常回答的错误率。
真正动手干活的Agent能力,则呈现出另一种参差。AutomationBench-AA上Argon以77.5%拿第一,但Terminal Bench 4里它得57%,虽然比Gemini 3.1 Pro Preview提高53个百分点,仍落后于Sonnet 5.5、Opus 5.5和Astra。AA-Briefcase也有类似反差:满足评分细则的比例达到65%、是AA测到的最高值,分析质量和呈现质量却偏低。能按要求交活,和交出一份分析透彻、表达清楚的成果,中间仍有距离。
安全领域更抓人。CWE-bench v1检查模型能否真正修好漏洞,Argon以68%并列第一。谷歌还称它能自行发现、验证漏洞并生成PoC,也就是证明漏洞确实存在的验证示例。修得怎样,终于可以沿着代码往下看了。
谷歌已经让它干上了机房里的活
比榜单更让我在意的,是谷歌自己的使用情况。据谷歌透露,Argon智能体分析了数据中心的性能数据,找到内存优化点,相关改动随后上线,释放了超过300 TiB内存。有正在运行的系统、有性能数据、有改动、也有部署后的结果,这是评测之外的证据。这里要说明,300 TiB指的是释放出来的内存容量,不能直接换算成省下多少电费或服务器采购费,材料没有给出这样的账。
同一份材料还提到,Argon正参与把C/C++代码迁移到Rust,涉及超过80万行内核代码,部署前要经过大量审计和测试。要分清,迁移仍在推进,不能把80万行都算成已经上线的成果。视频解码器的例子则更完整:谷歌称,智能体用安全Rust替换了3.2万行SIMD代码——这类代码负责让多份数据并行处理,对运行效率很重要。结果是现有Rust版本快了2.7倍,视频输出保持一致。速度提高,结果还得对得上,工程工作的要求就落在这里。
Argon支持1M Token上下文,可接收文字、图片、视频和语音,输出文本。对漫长任务,Gemini API新增的Long Decode Continuation允许长回复暂停,再通过后续调用接着输出,让推理最长跑到1M输出Token,避免请求超时。这里有两个不同的长度:上下文决定它一次能容纳多少材料,输出决定它能把过程持续多长。分次接着输出解决了长任务被请求超时打断的问题,至于最后做得对不对,仍要靠检查和测试。
OpenAI、Anthropic和谷歌的竞争,因此又有了三方较量的意味。折扣什么时候结束,榜单还能领先多久,都有变数。谷歌已经让AI参与改造自家基础设施,这件事更值得追踪。下次模型发布,我想多看一点这样的结果——修好了什么、省下了什么、哪些改动已经上线。53分令人兴奋,真正用起来之后留下的成果,才值得长期买单。