美版豆包又更新了!Gemini 3.8Flash是真Flash!

Gemini 这不声不响的家伙,更新速度真的是快!

Gemini 3.5 Pro 迟迟不出,Flash 版本一路狂飙,从 3.5 到 3.6 再到 3.7 再到 3.8 也没用多少时间。

谷歌在大模型上好像退出了巅峰赛,但是 Gemini 的 Flash 其实有一个巨大的优势:又快又便宜!

667d3671-a103-476b-b058-b02eba3bd525

这种快,不是一般的快,而是快如闪电的快,10 倍速吊打国内的 Flash。

今天这个 3.8 的版本好像在能力方面也提升了不少,G家的模型,性价比又悄悄凸显出来了。

基础情况

按照惯例,我们先看一下这次更新的基础情况。

image-20260903113715227

不得不说,Gemini 的新模型的关注度是真的低!居然只有 32 万查看!

为此我还特地去找了 Google 的账号:

它这个帖子稍微好一点!

介绍还是万年不变:

......我们迄今为止最佳的推理与编码模型......

这次不一样的一点是,同步更新了一个叫 Cyber 的模型,听名字,就知道这是一个和安全相关的模型了。

Gemini 3.8 的基准情况如下:

描述为:

Gemini 3.8 Flash:我们迄今为止最智能的多功能模型。它在编码、代理工作流以及关键的多步骤推理方面带来了升级,同时保持与 3.7 Flash 相同的速度和低成本。

Cyber部分的情况如下:

描述为:

Gemini 3.8 Flash Cyber:我们最具能力的网络安全模型,在漏洞检测和自动化修补方面提供前沿级性能。

最后有一个价格信息:

Gemini 3.8 Flash 以与 3.7 Flash 相同的介绍价格* 提供:百万输入令牌和3.75/百万输出令牌。

然后就没有然后了!

从贴出来的两项数据看,这次的 3.8 Flash 还是非常强的,直接把 GPT-5.6 Sol 和 Opus 5 都压下去了。

我找了一下它完整的基准数据:

谷歌还特地把价格也写到了表格里面,然后基准数据又有多项第一!看起来很不错的样子。

谷歌还专门分享了一个 DeepSWE 的测试数据:

结论是:在 DeepSWE v1.1(长周期软件工程)基准测试中,3.8 Flash 能够以极低的成本,在自主端到端解决复杂工程问题方面优于多数更大规模的前沿模型。

这是要用 Flash 的价格和速度,直接打爆人家的旗舰模型么?

这么一看性价比要拉爆了! 比 Sonnet 5 都便宜一半都不止啊!

下面我就上手试一试。除了看效果之外,我重点给大家看看 Flash 的速度,我会和 GLM5.3Flash 做一个对比。

下面就直接给测试结果了!

赛博朋克版清明上河图

这个例子是要结合清明上河图内容和赛博朋克风格。考验风格融合能力、创造力、审美、空间感等。

老例子了,就不多说其他了,直接看结果:

这个结果吧,谈不上空间感、审美这些,整体来说还是比较抽象。但是呢,也不能说很差,该有的好像也都有,运行呢也没啥错误!

整体来说,就是属于不突出,也不犯错! 有一点必须强调,它搞定这个例子,只用了 1 分钟。

甲维斯的车库

这个例子主要测试网页复刻能力和 3D 建模能力。

我会给两张参考图,一个是人物,一个是网页。让他复刻网页的效果,把人物放到里面。

结果如下:

这个 UI 复刻效果还是不错的。除了颜色部分多了两种颜色之外,其它细节都很好!

建模部分吧,不是太理想!!

我尝试过让他优化建模:

确实有优化,但是非常有限!

建模方面和 DS Flash,Qwen 3.8 Flash 半斤八两! 网页复刻方面,差得也不多,比 DS 好一些。

天文机械表

这个例子是考验大模型脑力的,同时也考验网页呈现能力。 这个题目的难点是:一次性提出N个有点难度需求,很容易分散AI模型的注意力,导致失误!

Gemini3.8Flash 这个样式和风格还是很不错,但是细节禁不起推敲,有两个小表盘设计得不是很好!我估计就是因为它一次性完成的缘故,有些智能体会一个一个拆解需求,一个一个验证,就不容易错。

游戏复刻

两个经典游戏复刻,我就不介绍了,直接上结果!

超级玛丽:

坦克大战:

这两个游戏,它都非常听劝,去查了资料,借鉴了代码,所以完成度比较高!

超级玛丽这边遇到了一个跳跃的问题,修复之后基本没有问题,整个地图还原度非常高,坦克大战是消墙逻辑有点问题,同样地图的还原度也很高。

Gemini 在游戏方面好像有它独特的画风,还是不错的!

这已经是中上水平了!

整体测下来,各方面综合一下,对比其它家的模型,水平不能算特别突出,中规中矩。

确实是 Flash 的水平,没有那种旗舰模型的惊艳感。

我感觉它在实战中是没法和 GPT-5.6 Sol 和 Claude Opus 5 比的。

中途出现了两个事故,我觉得也要提一下。

一个是它生成了代码,却不保存到电脑中!

一个是它覆盖了一个文件的代码!

这两个点暴露了它的 Agent 能力真的是"一坨"! 只生成代码不保存,这不就是 chat 么?还有乱覆盖文件,覆盖之前都不检查,不提醒,这个有点太弱智了。

所以它给我的感觉是 API 还挺强的,有时候调用一次就能干人家十次的活,但是它自家的 Antigravity + 模型本身的 Agent 能力非常弱。所以只适合执行中低难度的任务。复杂任务不是很靠谱。

速度对比

能力不算出彩,没有基准中那么强。但是它的速度是真的快!这个问题我必须单独起一个段落来讲,因为有些 Flash 实在是太慢了。

我就以甲维斯的车库为例。它们的结果都差不太多,但是时间上差太多了。

GLM5.3Flash 的情况如下:

刚开始就直接用了半个小时,但这还只是创建页面,不小心被我中断了。后来验证加更新代码又花了 40 分钟。

也就是这例子它总共用了 70 分钟!

Qwen 3.8 Flash 的情况:

我目前没有阿里家的会员。所以这次是白嫖了孙哥的中转站!

整个时间非常长。长达 2 个小时!

其中有一个 821 秒(十几分钟)跑的是《赛博朋克版清明上河图》!

这个速度应该是受到了中转的影响。

然后我又用 OpenCode 跑了一轮:

大概用了 32 分钟,开始进入验证阶段!

然后 OpenCode 又出问题了:

就是发什么都说 Bad Request! 我新启一个对话是正常的。在当前这个对话中死活无法继续!

让O哥分析了一下说是截图太大,放在上下文中导致调用被拒绝了!

OpenCode 这傻逼又不给我关键的提示信息,然后它也没有很好的处理图片上下文问题。总不可能上下文里不能有多图图吧?我 Codex,Claude 都是大量截图自查的!

DeepSeek Flash 的情况:

DS这个我有点没心情讲了,因为在我查看时间时候出了一个事故。

首先是,我本地的 DSH 突然消失了,重装后发现记录全无:

重新跑出现了一个错误,提示我没钱了。问题是,前几天刚充了 50 元啊!

然后我去 DeepSeek 后台看了一下,好家伙,我还倒欠 12 块钱了!

看了一下平台记录,是一个叫 my 的 API key 消耗的。

9 月 1 号,下午 5 点多,一下子消耗了 60 多块!flash,exp,pro 都有调用,各 40 次。

但是我完全不记得我 9 月 1 号创建过这个密钥。我当时正在研究 aiaiao 这个项目,最近这几天应该都没有打开过 DeepSeek 后台,没有启动过DSH(我可能失忆了)!

我查了一下,本地 agent 这几天都没有碰过这个 API key!

这个事情的诡异点是,本地的 DSH 突然没了,我不记得我创建了这个 key,我本地电脑上也没有这个 key 的信息。

应该没人会看上我几十块钱的 DeepSeek 账号吧??? 难道是我批评 DS 太多次了,DS 生气了,给我充公了,这也不可能吧!

这么一来,我在 DSH 上跑的例子也没有,数据全部被清空了。我就只能凭记忆说个大概了,DS 跑同一个测试的时间基本也是在十几分钟到几分钟的样子。DS本来是非常快的,但是最近的新版本,由于智能体流程的改进,以及复杂问题脑力不够,导致整个过程也慢了不少。

DSH 和 OpenCode 这两个东西,我是真的不太想用了!

收拾心情,继续。

Gemini 3.8 Flash 的情况:

同样的需求,它只花了 3 分钟!!!

DS 和 Qwen 这两个我反正很少用,我就不说了,我们来对比一下 GLM5.3Flash 吧!

比例是 3:70,大概 35 倍的时间差距!

如果一个例子还没有说服力,我可以再找一个!

比如《超级玛丽》这个例子。 GLM5.3Flash 消耗了 2 个小时

Gemini 3.8 Flash 消耗了 6 分钟

比例大概是 6:120,也就是 20 倍的样子。 这个例子已经是Gemini最慢的情况,大部分需求,三分钟内搞定。

你说同一个任务速度差个 100%,也不小了吧,现在是差 2000%~35000%!

当然,也可能和我测试的例子有关系,有些模型一看到我的例子,就觉得应该好好思考下,所以搞特别久,这个也是可能的。

但是,谷歌为啥一下子就搞完了呢?而且结果也是能看的!

所以我觉得现在国产 Flash 最大的问题是它一点都不 flash,它只是 small。 脑子不够,tokens 和时间来凑。同样的问题,消耗的时间巨多,浪费的 tokens 也不少。

只有谷歌这个 Flash,才真的配得上 Flash 的称号! 虽然它单价还不算最便宜,但是完成一个任务消耗的 tokens 目测会非常少,也就是单任务的消耗情况非常优秀。

天下武功唯快不破啊,能力达到基准线之后,速度就变得很重要了。国产模型的问题不是快不快,而是太慢了太慢了太慢了。

我让它校验一下文章,它都能给我搞 10 分钟!稍微复杂一点需求动不动就是半个小时,一个小时。

打个不恰当的比喻:裤子都错了,你让我磨一个小时的指甲,这种服务体验是很糟糕的!

谷歌这模型,能力不算顶级。但是性价比和速度绝对是拉爆了!

只要你有需求,立马开干,3 分钟搞定。

相关推荐
云智慧AIOps社区22 分钟前
2026年智能巡检机器人行业格局:三类厂商阵营、选型维度与产品推荐
运维·人工智能·机器人·巡检机器人
微三云 - 廖会灵 (私域系统开发)22 分钟前
重资产的突围:当酒店遇上 RWA,用服务权益数字化重构产业供需关系
人工智能·重构
阿里云大数据AI技术26 分钟前
从“找得到”到“找得准”:用 Hologres 构建智能达人圈选系统
大数据·人工智能
2601_9676598834 分钟前
艾雨文承推出大头阿亮第五代智能养老机器人机构版,助力养老机构智慧巡护升级
人工智能·机器人
智兆APS36 分钟前
价值测算与效益验证:缝制APS智能排产可量化收益评估、风险预判与价值闭环体系
人工智能·服装行业aps·缝制行业aps·包箱行业aps·鞋帽袜子行业aps
村口徐大爷40 分钟前
电商新媒体通用!Lingko AI全套视觉素材自动化量产落地实操教程
人工智能·ai·ai工具·电商运营·lingnko ai
杨航 AI44 分钟前
AI 质感纪录片短视频生成 Skill
人工智能·音视频
Profile排查笔记1 小时前
JavaScript 实现浏览器指纹生成:基础字段、Canvas 采样与 SHA-256 摘要
前端·人工智能·后端·自动化
凡泰极客科技1 小时前
凡泰极客亮相CIFS金融峰会,加速金融超级App建设,推动AI进入业务层
人工智能·金融