Google 发布 Gemini 4 Argon:把长流程编程与网络防御推向代理式工作流

Google DeepMind 9 月 30 日公布 Gemini 4 Argon,主打软件工程、企业知识工作及防御性网络安全;模型先向可信任的网络防御者分阶段开放,并设有较严格的前沿安全措施。

Google DeepMind 于 2026 年 9 月 30 日公布 Gemini 4 Argon,定位为新一代前沿模型,针对软件工程、法律及金融等企业知识工作,以及防御性网络安全。它不是一个立即全面公开的聊天模型,而是先通过 Fairwind 计划向一批可信任的网络防御者提供,之后再逐步扩大到开发者、企业及消费者。

Argon 的主线是长时间、多步骤工作。Google 表示模型的输出上限由过去的 64K tokens 提高到 100 万 tokens,让单一工作流可以保留更长的推理及产出空间。官方同时公布初始 API 价格为每百万个输入 tokens 2 美元、输出 tokens 10 美元,优惠期后会调整为 4 美元及 20 美元;这些是 Google 的定价公告,实际成本仍取决于工作流如何使用模型。

Google 也分享了几个内部使用案例。量子计算研究团队表示,Argon 协助把某些子程序的时空资源压低,示例中比已发表的基线改善 40%;另一个代理工作流分析数据中心的内存遥测,Google 表示部署后可释放超过 300 TiB 内存。这些数字是供应商自述的内部成果,并不是独立评估,阅读时应与可复现的外部测试分开看待。

在软件工程方面,Google 表示 Argon 代理正协助把 C/C++ 代码库迁移到 Rust,范围由数万行核心库延伸到超过 80 万行的 Fuchsia Zircon kernel。官方亦以 libgav1 作例子:代理通过多轮 profile-guided 实验及编译器分析,重写 32,000 行 SIMD 代码,声称得到与原输出相同、速度比原有 Rust 版本快 2.7 倍的解码器。大规模重写仍要经过自动及人工审计、模拟测试和代码审查,不能只依赖模型的完成报告。

Argon 也被设计成网络防御工具。Google 表示它可以自主寻找、验证及修补高风险漏洞,并通过 Wiz 的 Scan for Good 计划协助保护公共基础设施。这种能力具有明显的双重用途,所以 Google 先让可信任防御者试用,并在扩大推出前加强滥用防护、间接 prompt injection 防御、行动及推理监控,以及隔离和封存的 sandbox 环境。

这次发布反映前沿模型的竞争焦点正在由单次问答,转向能否在受控环境内维持长任务状态、调用工具、修改大型代码库,再让人类把关。长上下文并不等于可靠的长流程;工程团队仍需要固定版本、权限边界、测试、审批及可追溯的操作记录。尤其在网络安全及生产代码场景,模型能找到问题与模型可以安全地把修补部署出去,是两个不同的门槛。

因此,Gemini 4 Argon 更像是一次分阶段的能力展示,而非普遍可用产品的终局。Google 已公布很高的性能及内部成果,但模型仍在扩大开放前的安全测试阶段。对企业来说,最值得留意的不是单一 benchmark 排名,而是如何把长流程代理放进可回滚、可审计、有人类确认的工作系统。

MODULE.002 //

更多 Insights

分享网站、AI automation、数码营销、AI news 和 VMTS 公司新闻。