谷歌Gemini“草稿”先行:3.5 Pro延期背后的效率焦虑与前沿突围

谷歌Gemini“草稿”先行:3.5 Pro延期背后的效率焦虑与前沿突围

核心事件:7月21日,谷歌在旗舰模型Gemini 3.5 Pro延期之际,突然发布Gemini 3.6 Flash和Gemini 3.5 Flash-Lite两款新模型。这一举动引发了市场对谷歌AI战略重心及研发节奏的广泛讨论。


一、 “草稿纸”上的算盘:效率与成本的极致追求

按照原计划,代表谷歌最高技术实力的Gemini 3.5 Pro本应于今年6月上线。然而截至7月下旬,这款被寄予厚望的模型依然“难产”。面对旗舰缺席的空窗期,谷歌选择先交出两张关于“效率”的草稿——Gemini 3.6 FlashGemini 3.5 Flash-Lite

这两款产品的核心逻辑并非单纯追求智力上限,而是面向Agent(智能体)规模化应用和成本控制进行的深度优化。

1. Gemini 3.6 Flash:为Agent服务的高效引擎

Gemini 3.6 Flash的定位非常明确:服务于需要高频调用的真实生产环境。在Agent工作流中,一次任务往往涉及多轮调用,因此模型的响应速度和单token成本成为关键指标。

  • 成本优势:相比上一代Gemini 3.5 Flash,3.6 Flash保持了输入价格不变($1.50/百万token),但将输出价格从$9.00降低至$7.50/百万token
  • 效率提升:谷歌内部测试显示,在完成相同任务时,3.6 Flash的token消耗减少了55.8%,且任务评分从85分提升至100分。这意味着模型能用更少的计算资源完成更复杂的任务。
  • 能力进阶
    • DeepSWE代码评测:得分49%,较上代37%显著提升。
    • OSWorld-Verified(电脑操作):得分83%,超过上代的78.4%。
    • MLE Bench(机器学习任务):得分63.9%,较上代49.7%有明显进步。

尽管在Intelligence Index综合智力测试中,3.6 Flash得分50分,与上代持平,但其速度优势明显。据Artificial Analysis数据,其完成任务平均耗时约1.3分钟,仅为上代(约2.7分钟)的一半。

2. Gemini 3.5 Flash-Lite:能力下沉与极速响应

作为Flash系列中更轻量的版本,Gemini 3.5 Flash-Lite牺牲了部分能力上限以换取极致的速度和性价比。

  • 速度与性能:生成速度达到约350 token/秒,任务平均耗时仅约0.6分钟。虽然单价(输入$0.30,输出$2.50)比上一代3.1 Flash-Lite略高,但凭借更强的能力和更低的token消耗,整体成本仍具竞争力。
  • 越级挑战:令人意外的是,这款轻量模型在某些特定任务上超越了上一代旗舰Gemini 3 Flash:
    • SWE-Bench Pro:得分54.2%,高于Gemini 3 Flash的49.6%。
    • OSWorld-Verified:得分74.0%,高于Gemini 3 Flash的65.1%。
    • Terminal-Bench 2.1:得分54%,较上代31%几乎翻倍。

这表明,随着技术迭代,过去依赖大模型才能完成的Agent任务,正逐渐下沉到更便宜、更快的轻量级模型中。

3. 垂直领域拓展:Gemini 3.5 Flash Cyber

此外,谷歌还推出了针对网络安全场景的Gemini 3.5 Flash Cyber。该模型目前不向公众开放,仅通过CodeMender平台向政府和可信合作伙伴提供。在CyberGym基准测试中,其表现已接近前沿水平,体现了谷歌在垂直行业应用的布局。


二、 旗舰之困:Gemini 3.5 Pro为何迟迟不来?

相比于Flash系列的顺利推出,Gemini 3.5 Pro的延期成为了市场关注的焦点。

  • 延期事实:谷歌CEO Sundar Pichai在今年5月I/O大会上曾承诺,3.5 Pro将在“接下来一个月左右”推出。但据彭博社7月16日报道,该模型发布时间已落后原计划数月。
  • 延期原因:路透社最新报道指出,谷歌正在继续优化模型能力,特别是编码表现,以期达到内部设定的目标。目前该模型正处于与合作伙伴测试阶段,预计将“很快”推出。
  • 后续布局:更有消息透露,Gemini 4的训练工作已经启动。

Gemini 3.5 Pro不仅是谷歌冲击技术前沿的关键棋子,更是华尔街判断Google DeepMind能否在编码和复杂任务上跟上OpenAI和Anthropic的重要指标。编码能力的不足,直接影响了模型在企业级工作流中的实际价值。


三、 竞争格局:前有狼后有虎

谷歌在旗舰产品延期之际,选择以Flash系列填补市场空白,这一策略背后是日益激烈的竞争压力。

  1. 海外巨头追赶:在Gemini 3.6 Flash的横向对比中,GPT-5.6 Luna、Grok 4.5和Claude Sonnet 5在复杂软件工程和知识工作任务上仍保持优势。
  2. 国产模型崛起:近期,GLM-5.2Kimi K3等国产模型也开始进入前沿竞争行列,引发了大量讨论。这些模型在特定场景下的快速迭代,加剧了全球AI竞争的紧迫性。

在此背景下,谷歌CEO Sundar Pichai多次强调成本优势,声称企业将AI工作负载迁移至Gemini模型可每年节省超10亿美元。然而,市场期待的不仅仅是一张关于成本和效率的“草稿”,而是一份能证明其在硬核实力上不逊于竞品的“答卷”。


结语

Gemini 3.6 Flash和3.5 Flash-Lite的发布,展示了谷歌在AI规模化落地和成本控制上的坚定决心。通过提升Agent能力、优化Token效率,谷歌试图在“实用主义”路线上建立护城河。

然而,Gemini 3.5 Pro的延期及其背后的编码能力瓶颈,仍是悬在谷歌头顶的达摩克利斯之剑。在GLM-5.2、Kimi K3等新势力涌入的前沿竞争中,谷歌能否尽快拿出真正领先的旗舰模型,将决定其能否从“跟随者”彻底转变为“领跑者”。对于AI从业者和创业者而言,关注Flash系列带来的成本红利与Pro系列最终的性能突破,将是把握下一阶段AI应用风向的关键。