谷歌发布Gemini 3.6 Flash与3.5 Flash-Lite:聚焦Agent降本,Gemini 4预训练启动
谷歌在7月22日凌晨发布了三款新模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber。重点不是刷单次推理分数,而是降低Agent工作流在实际运行中的Token消耗、响应延迟和综合成本。
原定6月推出的Gemini 3.5 Pro仍未如期发布,目前还在合作伙伴测试阶段。谷歌同时宣布已启动公司迄今规模最大的预训练任务——Gemini 4。
Gemini 3.6 Flash 面向多模态、编程和知识类任务。在Artificial Analysis的Intelligence Index中,其任务Token消耗量比3.5 Flash减少了17%,DeepSWE测试中输出Token消耗从平均27.6万降至约9.7万,降幅约65%。多步骤工作流的推理步骤和工具调用次数也减少了。
基准方面:DeepSWE v1.1得分49%(3.5 Flash为37%),MLE-Bench得分63.9%(3.5 Flash为49.7%),GDPval-AA v2得分1421,OSWorld-Verified得分83.0%。
定价:输入每百万Token 1.5美元(约10.2元人民币),输出每百万Token 7.5美元(约51元)。JetBrains反馈低推理等级下编程性能提升10%-20%,Harvey称文档起草和审查快12%,Figma认为在质量、速度和成本之间取得了较好平衡。已通过Google AI Studio、Android Studio、Gemini API开放,企业客户可通过Gemini Enterprise Agent Platform使用。
Gemini 3.5 Flash-Lite 主打低延迟和高吞吐量,适合Agent搜索、文档处理等场景。生成速度每秒350个输出Token,位列榜单前两位。支持根据任务负载调整思考等级。
基准:Terminal-Bench 2.1得分54%(3.1 Flash-Lite为31%),GDM-MRCR v2得72.2%,GDPval-AA v2得1140,SWE-Bench Pro得54.2%(超过同系列Gemini 3 Flash的49.6%),OSWorld-Verified得74.0%(超过Gemini 3 Flash的65.1%)。
定价极低:输入每百万Token 0.3美元(约2元),输出每百万Token 2.5美元(约17元)。同样通过AI Studio、Android Studio、Gemini API开放,普通用户可在Gemini应用中使用,后续逐步接入谷歌搜索。
Gemini 3.5 Flash Cyber 专用于发现、验证和修复安全漏洞,基于3.5 Flash微调,配合代码安全Agent CodeMender使用——后者可同时运行多个Cyber Agent并合并分析结果。在CyberGym测试中(最多调用5次模型)得分83.2%,接近Anthropic Mythos 5的83.8%、OpenAI GPT-5.6 Sol的83.6%及Mythos Preview的83.1%。鉴于双重用途风险,暂不向普通开发者开放,近期将通过CodeMender面向政府机构和可信合作伙伴启动小范围试点。
市场位置
尽管速度和Token效率有改善,Gemini 3.6 Flash在综合智力与成本效益上仍面临压力。Intelligence Index得分仅50,落后于Claude Fable 5、GPT-5.6 Sol、Kimi K3、Grok 4.5、GLM-5.2,甚至低于Meta的Muse Spark 1.1。单任务成本0.50美元(约3.39元),高于DeepSeek、MiniMax、GLM、Muse Spark、Grok等模型。
速度是另一回事。Gemini 3.5 Flash-Lite和Gemini 3.6 Flash在输出速度上排前两位。
国产模型这边,月之暗面上周发布的Kimi K3,Intelligence得分仅次于Claude Fable 5和GPT-5.6 Sol,在前端编程测试中排到榜首。国产模型已从跟随者变成全球前沿竞争的参与者。
几个信号
谷歌这次更新的重心是降低Agent实际运行的总成本——减少输出Token、推理步骤和工具调用次数,配合低价和快速响应,吸引需要大规模部署Agent的企业和开发者。
产品路线有变化。Gemini 3.5 Pro原计划6月发布(5月I/O大会预告过),现在仍处于"准备就绪后尽快发布"的状态,主要在合作伙伴测试中。
Gemini 4的预训练已经启动,是谷歌迄今规模最大的一次。
安全方面,所有新模型加强了对化学、生物、放射性与核风险以及网络攻击滥用的防护,提高了抵抗越狱攻击的能力,同时减少了正常用途的错误拒绝。
数据来源:谷歌官方发布、X平台、Artificial Analysis榜单、早期客户反馈(Figma, Harvey, JetBrains, Ramp)
链接参考:智东西报道原文