GPT、Kimi、DeepSeek 多模态能力实测:open design设计任务中的公平对比

我做了一个实验。同样三个设计任务,同时交给 GPT-5.6、Kimi K3 和 DeepSeek V4 Flash Vision Exp。三组模型使用同一版 OpenDesign、同一批素材、同样的浏览器工具,每个任务允许一轮修复。结果挺意外:三家最终全部通过,DeepSeek 只花了约 1.35 元,速度也是最快的;GPT 的首版最稳;Kimi 做出了完整产品,但最依赖浏览器闭环。

DeepSeek 发布视觉实验模型后,我最想验证的不是它能不能识别图片。

识别文字、描述画面,只能算"看见"。真正做设计,还要理解信息层级、空间关系和品牌气质,把判断写成可以运行的页面,再从桌面和手机截图里发现溢出、截断和交互错误。

所以我做了一个实验。

同样三个设计任务,同时交给 GPT-5.6、Kimi K3 和 DeepSeek V4 Flash Vision Exp。三组模型使用同一版 OpenDesign、同一批素材、同样的浏览器工具,每个任务允许一轮修复。

结果挺意外:三家最终全部通过,DeepSeek 只花了约 1.35 元,速度也是最快的;GPT 的首版最稳;Kimi 做出了完整产品,但最依赖浏览器闭环。

大家好,我是陆徐洲。今天不看宣传 Demo,直接看三个模型真实干活。

01、三道题,三种差异场景

第一题叫 THALASSA。

输入包含 147 个 NOAA 年度数据点、世界地图、海域资料和 NASA 图片。模型要做一个滚动式海洋记忆展览,年份变化会驱动温度曲线,点击海域会切换地图和珊瑚风险。

这题看原创视觉和数据叙事。

GPT 的首屏最有杂志感,把 THALASSA 拆成两个巨大的单词压在卫星图上,视觉冲击最强。

Kimi 走了克制路线。深蓝星点背景、中文大标题、数据说明居中,信息很干净,惊艳度稍弱。

DeepSeek 介于两者之间。巨型英文标题、NASA 背景和右侧深度尺都做出来了,完成度很高。

第二题叫 SONORA。

我给了三张桌面和手机参考图、一份世界地图数据、5 个声音地点和 5 段真实 OGG 音频。模型要完成地图选点、播放、切歌、收藏、收藏集同步和刷新后状态恢复。

这题更接近真实产品,既要看懂参考图,也要把交互做对。

GPT 把标题、筛选器和地图拆成三个清楚区块,地图占比最大,最接近参考图的编辑设计感。手机首屏在地图下方刚刚露出 Lake Ontario 声音卡片;继续下拉后,可以看到完整的波形、播放控制、地点、许可和下一首队列。

Kimi 当前选中了 Lagos 的声音。它把标题和地图压得更紧,下拉后直接进入波形、播放按钮、地点、许可和下一首队列,三家里信息密度最高。它的首版地图曾坍缩到只有 2px,图中是经过浏览器检查和修复后的结果。

DeepSeek 当前播放 Lake Ontario。它把地图收进圆角卡片,又为声音增加了暖色封面;下拉后,封面、波形、播放控制和元数据保持了更均匀的间距,纵向阅读节奏最好,也加入了更多自己的视觉判断。

三家都选择了"地图在上、播放器在下"的长页面结构。上面三张图展示视觉理解、信息层级和下拉后的内容组织;真实音频播放、切歌、收藏及刷新后状态恢复由浏览器验收确认,三家最终全部通过。

第三题 ATELIER 最复杂。

这次没有页面参考图,只给 6 张大都会博物馆开放图片和一段产品说明。模型要自己设计项目总览、Moodboard、定位评论、版本审批和发布预览,还要实现创意总监、设计师、客户三种权限。

gpt-5.6 sol-high:

kimi k3:

DeepSeek V4 Flash Vision Exp:

GPT 做得最像成熟的创意工作室产品,品牌主视觉很强。Kimi 的素材墙和权限信息最直观。DeepSeek 更紧凑,项目、版本和活动记录一屏就能读完。

02、opendesign中的公平对比结果

DeepSeek 比 GPT 快 43.4%,价格差距更夸张。

但这里有个容易误解的地方。DeepSeek 的累计 Token 反而最高,接近 2942 万。这个数字包含 Agent 每轮工具调用时重复读取的缓存上下文,并不等于一次提示词塞了 2942 万 Token。它的输入缓存命中率达到 99.02%,所以 Token 很大,账单依然只有一块多。

这也是 Agent 测评和普通聊天测评最大的区别:模型只是变量之一,Harness 怎么管理上下文、图片和工具日志,同样会改变时间与成本。

03、最终都通过,首版差异很大

只看终版截图,会觉得三家已经没什么差距。日志给出了另一幅图景。

GPT 的首版问题最轻。THALASSA 主要是按钮高度只有 43px,SONORA 是手机地图太高、标题换行,ATELIER 是部分按钮没有达到 44px。核心流程基本都在。

Kimi 的问题更实质。SONORA 手机端地图首版只有 2px 高,整个地图几乎消失。ATELIER 里还出现了:

TypeError: route is not a function

原因是一个参数名遮蔽了全局路由函数。代码已经修好后,浏览器缓存又加载了旧 JavaScript,看起来像"修复失败"。最后关闭缓存强制刷新,错误才消失。

DeepSeek 的自我修复能力最让我意外。THALASSA 首次加载时图表路径是空的,"全部"海域按钮也没有事件;ATELIER 构建阶段出现过两处 JavaScript 语法错误。它自己运行页面、读取控制台、用 node --check 定位,最终全部修通。

所以这轮真正拉开差距的,是首版可靠性和修复成本。GPT 更像一个经验稳定的设计工程师,DeepSeek 像速度很快、愿意反复自查的新人,Kimi 能把复杂产品做完整,但浏览器闭环对它尤其重要。

04、OpenDesign 到底带来了什么

我还用同一个 GPT 模型,在 Codex 原生 Harness 下把三道题又跑了一遍。

结果同样是 3/3 通过,但时间从 1 小时 15 分降到 43 分 34 秒,累计 Token 从 2107 万降到 699 万,API 等价成本也减少了一半左右。

OpenDesign 的核心价值是把设计任务变成一套可审查的交付流程:先建立设计系统,再生成页面,保存首版快照,用浏览器检查桌面和手机,记录缺陷,完成一轮修复,最后留下截图、指标和验收报告。

Codex 原生更轻,执行更快,ATELIER 甚至做出了更大胆的荧光绿 Moodboard。OpenDesign 更规整、更可追溯,适合团队协作、交付和复盘。

从日志看,OpenDesign 也有工程成本。视觉分析工具超时后,Kimi 改成直接读取 PNG,完整 base64 被写进事件流,ATELIER 日志膨胀到约 9MB。三家任务结束后都出现过 CodeGraph 子进程没有退出,模型已经完成,外层脚本还在等。

这些问题提醒我,视觉闭环也需要工程化:截图应该按引用传递,日志需要控制体积,模型完成时间和基础设施收尾时间应该分开记录。

05、Claude design之外的我的选择

如果追求首版稳定和整体审美,我会优先 GPT。

如果追求速度、价格和足够好的最终完成度,DeepSeek 是这轮最惊喜的选择。三道复杂任务一共一块三,已经有能力进入真实设计原型工作流。

如果你已经在使用 Kimi Coding 订阅,Kimi 同样能完成复杂产品,建议给它配上严格的浏览器验收和一轮修复。

这轮实验之后,我对"多模态能力"的理解也变了。真正值得比较的单位,已经从一个模型,变成了:

模型 + Harness + 视觉验证 + 修复闭环。

会看图只是起点。能把画面变成可运行、可交互、可验收的产品,才算真正开始懂设计。

相关推荐
雾里看山7 小时前
大模型是什么:从 GPT 到开源大模型的演进脉络
gpt·开源
自律懒人8 小时前
匿名模型 OX Alpha 横评:DeepSWE 80% 反超 Fable 5 与 GPT-5.6 Sol,免费窗口最后 2 天
gpt·ai编程
平原201820 小时前
GPT Image 2 批量生图实战:网页验证与无限并发异步 API
gpt·gpt-image-2
进阶的小名21 小时前
Spring AI 2.0 探索:多 OpenAI-Compatible 模型接入,以及下一代 Session 记忆管理
java·人工智能·后端·gpt·spring·ai·chatgpt
捣鼓软件1 天前
告别“玄学咒语“:这个 GitHub 项目把 GPT-Image2 的提示词变成了“可复用代码“!
gpt·github
AI模型调用笔记1 天前
GPT-5.4 8月31日退出 Codex?先分清 ChatGPT 登录与 API Key,再迁移 Terra/Luna
人工智能·gpt·chatgpt·ai编程
yingyuecom1 天前
映悦AI × Joverse全球发布:四大重磅更新,AI创作进入工业化时代
人工智能·gpt·chatgpt·prompt·aigc
小弥儿1 天前
GPT Image 2 提示词库,把散落的生图提示词变成工程资产
开发语言·javascript·gpt·学习