
Google AI for Developers 在 2026 年 9 月 2 日的 release notes 宣布 Gemini 3.8 Flash 正式 GA。官方把它定位为可以用于 production 的 Flash 模型,主要针对长时间 software engineering、autonomous agents 和复杂 enterprise workflows。这次更新与 9 月 1 日推出的 agentic video understanding 放在同一周,显示 Google 正把「模型自己决定要取哪一段资料、做哪一步工具操作」推到 API 层。
Gemini 3.8 Flash 提供一百万 token context window、最高 64k output tokens,以及 low、medium、high 三个 thinking level。Medium 是默认值,Google 建议复杂 coding 和 Agent 工作使用 medium;即时聊天、incident response 或快速草稿则可用 low 来换取较低延迟。High 会让模型投入更多 reasoning 和 tool orchestration,成本和等待时间也应按工作负载重新测量。
官方公布的 introductory price 是每一百万 input tokens 0.75 美元、output tokens 3.75 美元,维持至 2026 年 12 月 31 日;2027 年 1 月 1 日起,标准价格为 1.50 美元和 7.50 美元。这是 Google 的 API 价格表,不代表一条 Agent 流程的总成本。长 context、重试、工具调用、验证步骤和模型思考 token,都可能让实际用量高于单次问答。
Google 也明确说明,3.8 Flash 会在困难、多步骤任务中使用更多 token,让模型分小步骤、反复调用工具并验证结果。这个设计有利于减少 Agent 走错一步后整段重做,但不是所有工作都值得使用最高 reasoning。企业应把成功率、延迟、token 消耗、工具错误和人工介入分开记录,而不是只比较一次回答的速度。
对于使用旧版 Gemini API 的团队,migration checklist 同样重要。Google 要求把 model ID 改为 gemini-3.8-flash,移除 temperature、top_p 和 top_k,将 thinking_budget 改为 thinking_level,并移除不支持的 candidate_count。新版本也要求检查 conversation turn、非空 user turn 和 function calling 的 call_id、name 等字段。模型升级因此不只是换一个字符串,还要重跑 request、tool call 和错误处理测试。
另一项更新是 agentic video understanding。Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 可以在 Interactions API 和 GenerateContent API 中按需查看 transcript、frame 或 audio,而不是先把整段视频静态转成大量 context。Google 表示长视频在特定方法下最多可以少用 88% token;这是官方产品说法,实际节省幅度仍会由视频长度、搜索范围、音画信息和任务目标决定。
这次 GA 的真正变化,是把「更强模型」和「可调运行成本」放在同一个 API 契约内。长流程 Agent 不应一律使用 high thinking;简单步骤可以降级,重要步骤才保留更多验证。这种分层也方便企业为不同工作设置预算、延迟上限和审批点。
不过,Google 的「production ready」、「state-of-the-art」及 Agent 可靠性描述仍属于供应商声明。采用前应以自己的 traces 和代表性任务做 replay,验证 context、function calling、工具重试、敏感数据边界和输出质量。GA 代表接口和支持状态较稳定,不代表每个业务流程都已经安全或值得自动化。



