谷歌继续挤牙膏!Gemini 3.6 Flash 刚刚上线,3.5 Pro 还在难产

谷歌继续“挤牙膏”?Gemini 3.6 Flash 发布背后的效率焦虑与竞争困局

在人工智能大模型领域,近期市场呈现出白热化的竞争态势。就在刚刚,谷歌发布了新模型 Gemini 3.6 Flash,同时推出了轻量级的 3.5 Flash-Lite 以及仅限政府使用的 3.5 Flash Cyber。然而,备受期待的旗舰级 3.5 Pro 却依旧处于“搁浅”状态。

在竞品纷纷推出重磅更新的背景下,谷歌此次的更新显得尤为谨慎。本文将基于最新发布的材料,深度解析 Gemini 3.6 Flash 的技术定位及其在市场中的真实竞争力。

一、 巨头竞速:谷歌的“追赶”时刻

回顾过去一个月,AI 领域的头部玩家动作频频,技术迭代速度惊人:

  • 6 月 9 日:Anthropic 发布 Claude Fable 5,迅速登顶综合榜单第一。
  • 7 月 9 日:OpenAI 发布 GPT-5.6 Sol,成为 Fable 5 的有力挑战者。
  • 7 月 16 日:月之暗面发布 Kimi K3,拥有 2.8 万亿参数,创下全球最大开源模型的纪录。
  • 7 月 19 日:阿里紧随其后放出 Qwen3.8-Max 预览版,参数量达 2.4 万亿。

在此背景下,谷歌于近日发布的 Gemini 3.6 Flash,试图在激烈的竞争中稳住阵脚。

二、 Gemini 3.6 Flash:主打“省钱”而非“最强”

从发布策略来看,Gemini 3.6 Flash 的核心卖点并非极致的性能突破,而是 Token 效率的提升,即通过降低资源消耗来为用户省钱。

1. 效率显著提升

在长周期编程任务 DeepSWE 的测试中,数据对比如下:
* 上一代 (3.5 Flash):平均消耗 27.6 万 输出 token。
* 新一代 (3.6 Flash):仅消耗 9.7 万 输出 token。
* 结果:节省了 65% 的 Token 用量。

与此同时,模型的定价也随之调整,从每百万 token 9 美元降至 7.5 美元

2. 性能微幅进步

谷歌官方博客重点展示了其与自家旧版本的对比,各项指标均有提升:
* DeepSWE(长周期编程):从 37% 提升至 49%
* MLE-Bench(机器学习研究):从 49.7% 提升至 63.9%
* OSWorld-Verified(电脑操控):从 78.4% 提升至 83.0%

三、 第三方测评:谷歌陷入“前十困境”

尽管谷歌强调内部进步,但在第三方权威机构 Artificial Analysis 的排行榜上,Gemini 3.6 Flash 的表现却略显尴尬。

该排行榜覆盖全球 187 个模型,Gemini 3.6 Flash 的综合得分仅为 50 分,与其前代产品 Gemini 3.5 Flash 分数完全一致。目前,它仅排在第 11 名,未能进入前十。

1. 竞品碾压

在前十名的席位中,各大模型表现优异:
1. Claude Fable 5:60 分
2. GPT-5.6 Sol:59 分
3. Kimi K3:57 分
4. Claude Opus 4.8:56 分
5. GPT-5.6 Terra:55 分
6. Grok 4.5:54 分
7. Claude Sonnet 5:53 分

2. 核心能力差距

在软件工程测试 SWE-Bench Pro 中,Gemini 3.6 Flash 的得分为 58.7%,落后于其他三家竞品:
* GPT-5.6 Luna:62.7%
* Grok 4.5:64.7%
* Claude Sonnet 5:63.2%

而在 DeepSWE 测试中,差距更为明显:
* GPT-5.6 Luna(GPT-5.6 系列中最弱、最便宜的版本):得分高达 67%
* Gemini 3.6 Flash:仅得 49%

这表明,尽管谷歌在卷效率和性价比(此前已有 Grok 4.5 瞄准此赛道),但在核心性能上,谷歌似乎已失去了昔日的优势。

四、 旗舰缺席:3.5 Pro 的“难产”

相较于 3.6 Flash 的“挤牙膏”,更令人关注的是其旗舰模型 Gemini 3.5 Pro 的缺席。

早在今年 5 月的 I/O 大会上,谷歌曾承诺 3.5 Pro 将在下月发布,但这一承诺并未兑现。据爆料,该模型的开发过程一波三折:
1. 未达预期:在编程任务上未达到内部标准。
2. 二次尝试失败:6 月底更换训练数据重新训练,结果仍不理想。
3. 推倒重来:DeepMind 团队被迫重构模型关键部分。
4. 官方回应:截至文章撰写时,官方说法仅为“正在与合作伙伴测试”。

自今年 2 月发布 Gemini 3.1 Pro 以来,谷歌已近半年未推出新的 SOTA(State-of-the-Art)级别模型。3.5 Pro 的延期导致谷歌母公司 Alphabet 股价在 7 月 16 日应声下跌。

五、 结语

除了备受争议的 3.6 Flash,谷歌此次还推出了更具性价比的 Gemini 3.5 Flash-Lite。其 API 定价极具侵略性:输入每百万 token 仅 0.3 美元,输出 2.5 美元,且输出速度可达 350 token/s

然而,对于 AI 从业者和开发者而言,单纯的低成本若无法弥补性能的短板,或许难以在高端市场形成足够壁垒。下一代预训练已悄然启动,而上一代旗舰仍在测试中徘徊。谷歌在“死磕 Flash”的同时,亟需解决其在顶级模型竞赛中掉队的现实问题。