abc小站

2026-09-03

Gemini 3.8 Flash:同价换更强推理,还有给防守方的 Cyber

六周里第三版 Flash。Google 把推理和写代码又抬了一档,价格先按 3.7 的 introductory 价走;另开一条只给可信防守方的 Cyber。

2026 年 9 月 2 日,Google 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber。官方说这是继三周前 3.7 Flash 之后、六周内第三次 Flash 更新。两边共用同一套基础能力,再靠长跑 agentic 循环去递归评测和打磨模型。

3.8 Flash 能干啥

官方把它定位成「最智能的主力模型」:软件工程、agent 任务,以及金融、法律这类要多步推理的专业场景,相对 3.7 Flash 都有明显提升。DeepSWE v1.1(长程软件工程)上,它能以更低成本接近甚至超过不少更贵的 frontier 模型。HLE-Verified 报到 54.9%。Vals Finance Agent V2 和 Harvey Legal Agent Benchmark 也被点名为优势场景。

设计选择很直白:复杂任务上它会多走几步推理、多调几次工具。算力紧时可以调低 effort,或继续用仍受支持的 3.7 Flash。

价格和入口

Flash Cyber:只给防守方

Flash Cyber 侧重漏洞发现和自动打补丁,通过新建的 Fairwind Program 开放给可信政府机构、关键基础设施运营方和软件维护者。CyberGym 上达到 frontier 水平;内部跨 20 种语言的漏洞发现基准成功率超过 70%。CWE-Bench(Collinear)pass@1 为 47.2%,接近更大模型的 47.8%,成本更低。

Google 自家用法:Chrome Security 团队称,相对最佳商业大模型,正确补丁数量约 2.6 倍;Wiz 在内部渗透测试基准上 recall 高 7.5–9.7%,成本约为竞品的 1/2.3–1/5.2。Cloud Vulnerability Research 团队用它在不到两小时内找到一处通常要数月才能摸到的关键基础漏洞。

主要依据 Google 官方博文 Introducing Gemini 3.8 Flash and 3.8 Flash Cyber(2026-09-02)。