Google DeepMind 发布轻量级网络安全模型 Gemini 3.5 Flash Cyber
2026年7月21日,Google DeepMind 正式推出了一款专为网络安全领域设计的轻量级模型——Gemini 3.5 Flash Cyber。作为 Gemini 3.5 Flash 的垂直微调版本,该模型旨在以极高的效率和速度,协助安全团队完成软件漏洞的发现、验证及修补工作。
定位与部署:在速度与成本之间寻找平衡
面对 AI 代理在漏洞挖掘速度上逐渐超越人类防御者的趋势,Google 强调亟需一种既强大又具备成本效益的解决方案。Gemini 3.5 Flash Cyber 凭借其出色的轻量化特性,被定位为大规模代码库扫描、敏感发布流程以及提交扫描管道的理想工具。
考虑到该技术的“双重用途”性质(即防御者与攻击者均可能使用),Google 采取了审慎的部署策略:
* 试点计划先行:首先通过 CodeMender 工具,向政府机构和受信任合作伙伴开放有限访问权限。
* 逐步推广:CodeMender 的基础能力随后将通过 Gemini Enterprise Agent Platform 向更广泛的企业客户开放。
技术突破:破解“搜索空间”瓶颈
传统大语言模型在处理庞大代码库时,往往面临单次调用成本高昂、分析路径受限的瓶颈。Gemini 3.5 Flash Cyber 的核心优势在于其高效性,使得 AI 代理能够在短时间内多次调用模型,从而覆盖更多的代码路径。
在 CodeMender 的多代理协作架构中,主代理最多可调用 3.5 Flash Cyber 五次,由子代理并行分析大量代码路径,最终整合生成一份高质量的漏洞报告。这种机制在实际测试中展现出了惊人的发现能力:
- V8 引擎测试表现:在针对复杂的 V8 JavaScript 引擎的固定调用次数测试中,3.5 Flash Cyber 成功发现了 55 个唯一确认的问题。
- 对比优势:相比之下,主线版 3.5 Flash 发现了 47 个问题,而 Claude Opus 4.6 仅发现 36 个。
- 独家发现:其中包含 10 个其他两个模型均未能捕捉到的关键问题。
基准测试与实际应用验证
Google 从多个维度对该模型进行了严格评估,结果令人印象深刻:
- CyberGym 基准测试:在对抗数百个真实软件漏洞的评估中,结合 CodeMender 多轮调用的配置,该代理的整体性能足以与显著更大的模型相竞争。
- Big Sleep 独立评估:专注于 Chrome 和 Safari 等复杂代码库中的关键漏洞,3.5 Flash Cyber 的表现显著超越了主线 3.5 Flash 及 3.6 Flash 模型。
- Chrome 生产环境实战:在生产提交扫描管道中,3.5 Flash Cyber 相比前代模型有显著提升。值得注意的是,由于内置的安全护栏限制,竞争对手的更新版本(如 Opus 4.6)拒绝了相关任务执行,因此未列入对比。
实战案例:
Google Cloud Vulnerability Research 团队利用该模型展现了惊人的实战效率:
* 在 2小时 内发现了公共 API 中的远程代码执行漏洞。
* 在一个敏感的生产服务中定位到了内存损坏漏洞。
* 甚至生成了一个能够绕过 ASLR 和 W^X 等标准缓解技术的远程代码执行 exploit。
数据驱动的训练基石
模型的高效并非偶然,而是建立在 Google 长期积累的软件安全数据之上:
* OSV.dev:利用包含超过 700,000 个开源漏洞的数据库进行训练。
* OSS-Fuzz:融入了超过 10 年的模糊测试(Fuzzing)结果数据。
这些丰富的资源帮助模型学习了真实安全专家的工作逻辑,使其能够熟练操作行业标准工具,并独立完成那些通常需要数小时深度分析的安全任务。
目前,Gemini 3.5 Flash Cyber 已正式入驻 Chrome、Android、Cloud、Ads 和 YouTube 等 Google 核心内部代码库,开始持续发现并修复潜在漏洞,标志着 AI 辅助网络安全进入了一个新的里程碑。