Gemini 这不声不响的家伙,更新速度真的是快!
Gemini 3.5 Pro 迟迟不出,Flash 版本一路狂飙,从 3.5 到 3.6 再到 3.7 再到 3.8 也没用多少时间。

谷歌在大模型上好像退出了巅峰赛,但是 Gemini 的 Flash 其实有一个巨大的优势:又快又便宜!

667d3671-a103-476b-b058-b02eba3bd525
这种快,不是一般的快,而是快如闪电的快,10 倍速吊打国内的 Flash。
今天这个 3.8 的版本好像在能力方面也提升了不少,G家的模型,性价比又悄悄凸显出来了。
基础情况
按照惯例,我们先看一下这次更新的基础情况。

image-20260903113715227
不得不说,Gemini 的新模型的关注度是真的低!居然只有 32 万查看!
为此我还特地去找了 Google 的账号:

它这个帖子稍微好一点!
介绍还是万年不变:
......我们迄今为止最佳的推理与编码模型......
这次不一样的一点是,同步更新了一个叫 Cyber 的模型,听名字,就知道这是一个和安全相关的模型了。
Gemini 3.8 的基准情况如下:

描述为:
Gemini 3.8 Flash:我们迄今为止最智能的多功能模型。它在编码、代理工作流以及关键的多步骤推理方面带来了升级,同时保持与 3.7 Flash 相同的速度和低成本。
Cyber部分的情况如下:

描述为:
Gemini 3.8 Flash Cyber:我们最具能力的网络安全模型,在漏洞检测和自动化修补方面提供前沿级性能。
最后有一个价格信息:
Gemini 3.8 Flash 以与 3.7 Flash 相同的介绍价格* 提供:百万输入令牌和3.75/百万输出令牌。
然后就没有然后了!
从贴出来的两项数据看,这次的 3.8 Flash 还是非常强的,直接把 GPT-5.6 Sol 和 Opus 5 都压下去了。
我找了一下它完整的基准数据:

谷歌还特地把价格也写到了表格里面,然后基准数据又有多项第一!看起来很不错的样子。
谷歌还专门分享了一个 DeepSWE 的测试数据:

结论是:在 DeepSWE v1.1(长周期软件工程)基准测试中,3.8 Flash 能够以极低的成本,在自主端到端解决复杂工程问题方面优于多数更大规模的前沿模型。
这是要用 Flash 的价格和速度,直接打爆人家的旗舰模型么?
这么一看性价比要拉爆了! 比 Sonnet 5 都便宜一半都不止啊!
下面我就上手试一试。除了看效果之外,我重点给大家看看 Flash 的速度,我会和 GLM5.3Flash 做一个对比。
下面就直接给测试结果了!
赛博朋克版清明上河图
这个例子是要结合清明上河图内容和赛博朋克风格。考验风格融合能力、创造力、审美、空间感等。
老例子了,就不多说其他了,直接看结果:

这个结果吧,谈不上空间感、审美这些,整体来说还是比较抽象。但是呢,也不能说很差,该有的好像也都有,运行呢也没啥错误!
整体来说,就是属于不突出,也不犯错! 有一点必须强调,它搞定这个例子,只用了 1 分钟。
甲维斯的车库
这个例子主要测试网页复刻能力和 3D 建模能力。
我会给两张参考图,一个是人物,一个是网页。让他复刻网页的效果,把人物放到里面。
结果如下:

这个 UI 复刻效果还是不错的。除了颜色部分多了两种颜色之外,其它细节都很好!
建模部分吧,不是太理想!!
我尝试过让他优化建模:

确实有优化,但是非常有限!
建模方面和 DS Flash,Qwen 3.8 Flash 半斤八两! 网页复刻方面,差得也不多,比 DS 好一些。
天文机械表
这个例子是考验大模型脑力的,同时也考验网页呈现能力。 这个题目的难点是:一次性提出N个有点难度需求,很容易分散AI模型的注意力,导致失误!

Gemini3.8Flash 这个样式和风格还是很不错,但是细节禁不起推敲,有两个小表盘设计得不是很好!我估计就是因为它一次性完成的缘故,有些智能体会一个一个拆解需求,一个一个验证,就不容易错。
游戏复刻
两个经典游戏复刻,我就不介绍了,直接上结果!
超级玛丽:

坦克大战:

这两个游戏,它都非常听劝,去查了资料,借鉴了代码,所以完成度比较高!
超级玛丽这边遇到了一个跳跃的问题,修复之后基本没有问题,整个地图还原度非常高,坦克大战是消墙逻辑有点问题,同样地图的还原度也很高。
Gemini 在游戏方面好像有它独特的画风,还是不错的!
这已经是中上水平了!
整体测下来,各方面综合一下,对比其它家的模型,水平不能算特别突出,中规中矩。
确实是 Flash 的水平,没有那种旗舰模型的惊艳感。
我感觉它在实战中是没法和 GPT-5.6 Sol 和 Claude Opus 5 比的。
中途出现了两个事故,我觉得也要提一下。
一个是它生成了代码,却不保存到电脑中!
一个是它覆盖了一个文件的代码!
这两个点暴露了它的 Agent 能力真的是"一坨"! 只生成代码不保存,这不就是 chat 么?还有乱覆盖文件,覆盖之前都不检查,不提醒,这个有点太弱智了。
所以它给我的感觉是 API 还挺强的,有时候调用一次就能干人家十次的活,但是它自家的 Antigravity + 模型本身的 Agent 能力非常弱。所以只适合执行中低难度的任务。复杂任务不是很靠谱。
速度对比
能力不算出彩,没有基准中那么强。但是它的速度是真的快!这个问题我必须单独起一个段落来讲,因为有些 Flash 实在是太慢了。
我就以甲维斯的车库为例。它们的结果都差不太多,但是时间上差太多了。
GLM5.3Flash 的情况如下:

刚开始就直接用了半个小时,但这还只是创建页面,不小心被我中断了。后来验证加更新代码又花了 40 分钟。
也就是这例子它总共用了 70 分钟!
Qwen 3.8 Flash 的情况:

我目前没有阿里家的会员。所以这次是白嫖了孙哥的中转站!
整个时间非常长。长达 2 个小时!
其中有一个 821 秒(十几分钟)跑的是《赛博朋克版清明上河图》!
这个速度应该是受到了中转的影响。
然后我又用 OpenCode 跑了一轮:

大概用了 32 分钟,开始进入验证阶段!
然后 OpenCode 又出问题了:

就是发什么都说 Bad Request! 我新启一个对话是正常的。在当前这个对话中死活无法继续!
让O哥分析了一下说是截图太大,放在上下文中导致调用被拒绝了!
OpenCode 这傻逼又不给我关键的提示信息,然后它也没有很好的处理图片上下文问题。总不可能上下文里不能有多图图吧?我 Codex,Claude 都是大量截图自查的!
DeepSeek Flash 的情况:
DS这个我有点没心情讲了,因为在我查看时间时候出了一个事故。
首先是,我本地的 DSH 突然消失了,重装后发现记录全无:

重新跑出现了一个错误,提示我没钱了。问题是,前几天刚充了 50 元啊!
然后我去 DeepSeek 后台看了一下,好家伙,我还倒欠 12 块钱了!

看了一下平台记录,是一个叫 my 的 API key 消耗的。
9 月 1 号,下午 5 点多,一下子消耗了 60 多块!flash,exp,pro 都有调用,各 40 次。
但是我完全不记得我 9 月 1 号创建过这个密钥。我当时正在研究 aiaiao 这个项目,最近这几天应该都没有打开过 DeepSeek 后台,没有启动过DSH(我可能失忆了)!
我查了一下,本地 agent 这几天都没有碰过这个 API key!

这个事情的诡异点是,本地的 DSH 突然没了,我不记得我创建了这个 key,我本地电脑上也没有这个 key 的信息。
应该没人会看上我几十块钱的 DeepSeek 账号吧??? 难道是我批评 DS 太多次了,DS 生气了,给我充公了,这也不可能吧!
这么一来,我在 DSH 上跑的例子也没有,数据全部被清空了。我就只能凭记忆说个大概了,DS 跑同一个测试的时间基本也是在十几分钟到几分钟的样子。DS本来是非常快的,但是最近的新版本,由于智能体流程的改进,以及复杂问题脑力不够,导致整个过程也慢了不少。
DSH 和 OpenCode 这两个东西,我是真的不太想用了!
收拾心情,继续。
Gemini 3.8 Flash 的情况:
同样的需求,它只花了 3 分钟!!!

DS 和 Qwen 这两个我反正很少用,我就不说了,我们来对比一下 GLM5.3Flash 吧!
比例是 3:70,大概 35 倍的时间差距!
如果一个例子还没有说服力,我可以再找一个!
比如《超级玛丽》这个例子。 GLM5.3Flash 消耗了 2 个小时。

Gemini 3.8 Flash 消耗了 6 分钟!

比例大概是 6:120,也就是 20 倍的样子。 这个例子已经是Gemini最慢的情况,大部分需求,三分钟内搞定。
你说同一个任务速度差个 100%,也不小了吧,现在是差 2000%~35000%!
当然,也可能和我测试的例子有关系,有些模型一看到我的例子,就觉得应该好好思考下,所以搞特别久,这个也是可能的。
但是,谷歌为啥一下子就搞完了呢?而且结果也是能看的!
所以我觉得现在国产 Flash 最大的问题是它一点都不 flash,它只是 small。 脑子不够,tokens 和时间来凑。同样的问题,消耗的时间巨多,浪费的 tokens 也不少。
只有谷歌这个 Flash,才真的配得上 Flash 的称号! 虽然它单价还不算最便宜,但是完成一个任务消耗的 tokens 目测会非常少,也就是单任务的消耗情况非常优秀。
天下武功唯快不破啊,能力达到基准线之后,速度就变得很重要了。国产模型的问题不是快不快,而是太慢了太慢了太慢了。

我让它校验一下文章,它都能给我搞 10 分钟!稍微复杂一点需求动不动就是半个小时,一个小时。
打个不恰当的比喻:裤子都错了,你让我磨一个小时的指甲,这种服务体验是很糟糕的!
谷歌这模型,能力不算顶级。但是性价比和速度绝对是拉爆了!
只要你有需求,立马开干,3 分钟搞定。