
Google DeepMind 于 2026 年 7 月 21 日推出 Gemini 3.5 Flash Cyber,一个基于 Gemini 3.5 Flash、针对漏洞发现、验证和修补而微调的 cybersecurity model。Google 的切入点不是只靠一个大型模型完成一次扫描,而是把更快、成本更低的模型放进 CodeMender 的多步骤防守流程。
Google 表示,CodeMender 会多次调用 3.5 Flash Cyber,让 agent 分析更大的代码库和更多执行路径,再由子 agent 整合成一份报告。这种安排把漏洞研究视为搜索空间问题:一次昂贵调用可能只看到少数路径,而多次可重复扫描可以增加覆盖率,也更适合定期检查、发布前测试和 commit scanning pipeline。
Gemini 3.5 Flash Cyber 的部署会分阶段进行。Google 表示,模型初期会通过 CodeMender 以 limited-access pilot 提供给政府和 trusted partners,之后再逐步扩大;CodeMender 的基础能力则会通过 Gemini Enterprise Agent Platform 提供给客户。这个安排反映漏洞研究的 dual-use 性质:同一种能力可以帮助防守者,也可能增加被滥用的风险。
Google 公布的测试包括 CyberGym、Big Sleep 的内部评估、Chrome production commit scanning,以及 V8 JavaScript Engine 的比较。Google 表示,在固定次数的 V8 测试中,3.5 Flash Cyber 找到 55 个已确认的独特问题,mainline 3.5 Flash 找到 47 个,Claude Opus 4.6 找到 36 个。这些是供应商公布的测试结果,部分比较数字来自 provider self-reported scores,不能直接视为独立基准。
这次更新更值得留意的,是专门模型与 agent 流程的结合。安全扫描不只需要模型看懂一段 code,也需要它持续追踪多条路径、避免重复同一发现、整理证据,并把结果交给人员审查。实际部署仍要加入权限隔离、测试环境、修补审批、回归测试和负责任披露,不能把模型报告直接等同于可接受的漏洞修复。
对工程团队而言,这个方向可能降低高频扫描的成本,但也会把验证工作推到更前面。采用者需要分开衡量发现率、误报率、修补成功率、重复发现和人工审查时间,再决定 agent 可以做到哪一步。模型越快,不代表团队可以跳过安全边界和人工确认。



