刚刚,Google DeepMind 官宣发布了两个新 Gemini 模型:Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。

3.8 Flash 是目前 Flash 系列里最智能的一个,在软件工程、Agent 任务和多步推理上相比于 3.7 Flash 都有了显著的提升。

Logan Kilpatrick 还提醒补充说:这已经是 6 周内 Flash 系列的第 3 次更新了。
这节奏……是有点卷起来了。
先看成绩单:

我们来看其中比较亮眼的几个:
DeepSWE v1.1(长周期软件工程)上拿到了 73.7%,跟 Claude Opus 5 的 74.0% 几乎持平,而上一代 3.7 Flash 只有 65.3%。
一个 Flash 级别的模型做到这个程度,那 Pro……是还在藏着大招?
Terminal-bench 2.1(Agent 终端编程)上 89.4%,甚至微超了 Opus 5 的 89.1%。

Harvey's Legal Agent Benchmark(复杂法律工作流)上 10.0% 全场最高(其实大家整体都不太行……)。

Vals Finance Agent v2(金融分析师任务)上 61.4%,也是全场第一,超过了 Opus 5 的 58.6%。
当然,新模型也还有些明显的短板。
在 Terminal-bench 4.0 上只有 19.1%,Opus 5 则是 51.8%,差距依然巨大……OSWorld-2.0(Agent 桌面操作)上 59.0%,也远不如 Opus 5 的 75.4%。
怎么说呢,只能说 Google 也是足够坦诚,毫无宣传技巧了。不过一个 Flash 级别的模型,在不少 Agent 和编程的 benchmark 上能跟 Opus 5 勉强打平,性价比依旧超高。
3.8 Flash 跟 3.7 Flash 的速度相当,非常之快:

价格也完全一样:
• 输入:$0.75 / 1M tokens(优惠价,常规价 $1.50)
• 输出:$3.75 / 1M tokens(优惠价,常规价 $7.50)
优惠价有效期到 2026 年 12 月 31 日,26 年的最后一天。

对比 Opus 5 的 $5 / $25,3.8 Flash 的输入和输出价格大概只有 Opus 5 的 15%。
同样的预算下,能跑的任务多了好多倍,适合用来大规模跑些难度适中的 Agent 任务。
同时发布的另一个新模型 3.8 Flash Cyber,则是专门面向网络安全场景的。

主打的是前沿级别的漏洞检测和自动补丁修复能力,这算是 Google 在垂直领域专用模型上的又一步了。

3.8 Flash 目前已经在 Gemini API、AI Studio、Antigravity、Gemini App 等平台上线,均可以直接使用。
◇ ◆ ◇
Google DeepMind:https://x.com/GoogleDeepMind/status/2095175498967949359
Logan Kilpatrick:https://x.com/OfficialLoganK/status/2095175881690173885