我做了一个实验。同样三个设计任务,同时交给 GPT-5.6、Kimi K3 和 DeepSeek V4 Flash Vision Exp。三组模型使用同一版 OpenDesign、同一批素材、同样的浏览器工具,每个任务允许一轮修复。结果挺意外:三家最终全部通过,DeepSeek 只花了约 1.35 元,速度也是最快的;GPT 的首版最稳;Kimi 做出了完整产品,但最依赖浏览器闭环。
DeepSeek 发布视觉实验模型后,我最想验证的不是它能不能识别图片。
识别文字、描述画面,只能算"看见"。真正做设计,还要理解信息层级、空间关系和品牌气质,把判断写成可以运行的页面,再从桌面和手机截图里发现溢出、截断和交互错误。
所以我做了一个实验。
同样三个设计任务,同时交给 GPT-5.6、Kimi K3 和 DeepSeek V4 Flash Vision Exp。三组模型使用同一版 OpenDesign、同一批素材、同样的浏览器工具,每个任务允许一轮修复。
结果挺意外:三家最终全部通过,DeepSeek 只花了约 1.35 元,速度也是最快的;GPT 的首版最稳;Kimi 做出了完整产品,但最依赖浏览器闭环。
大家好,我是陆徐洲。今天不看宣传 Demo,直接看三个模型真实干活。
01、三道题,三种差异场景
第一题叫 THALASSA。
输入包含 147 个 NOAA 年度数据点、世界地图、海域资料和 NASA 图片。模型要做一个滚动式海洋记忆展览,年份变化会驱动温度曲线,点击海域会切换地图和珊瑚风险。
这题看原创视觉和数据叙事。
GPT 的首屏最有杂志感,把 THALASSA 拆成两个巨大的单词压在卫星图上,视觉冲击最强。
Kimi 走了克制路线。深蓝星点背景、中文大标题、数据说明居中,信息很干净,惊艳度稍弱。
DeepSeek 介于两者之间。巨型英文标题、NASA 背景和右侧深度尺都做出来了,完成度很高。
第二题叫 SONORA。
我给了三张桌面和手机参考图、一份世界地图数据、5 个声音地点和 5 段真实 OGG 音频。模型要完成地图选点、播放、切歌、收藏、收藏集同步和刷新后状态恢复。
这题更接近真实产品,既要看懂参考图,也要把交互做对。
GPT 把标题、筛选器和地图拆成三个清楚区块,地图占比最大,最接近参考图的编辑设计感。手机首屏在地图下方刚刚露出 Lake Ontario 声音卡片;继续下拉后,可以看到完整的波形、播放控制、地点、许可和下一首队列。
Kimi 当前选中了 Lagos 的声音。它把标题和地图压得更紧,下拉后直接进入波形、播放按钮、地点、许可和下一首队列,三家里信息密度最高。它的首版地图曾坍缩到只有 2px,图中是经过浏览器检查和修复后的结果。
DeepSeek 当前播放 Lake Ontario。它把地图收进圆角卡片,又为声音增加了暖色封面;下拉后,封面、波形、播放控制和元数据保持了更均匀的间距,纵向阅读节奏最好,也加入了更多自己的视觉判断。
三家都选择了"地图在上、播放器在下"的长页面结构。上面三张图展示视觉理解、信息层级和下拉后的内容组织;真实音频播放、切歌、收藏及刷新后状态恢复由浏览器验收确认,三家最终全部通过。
第三题 ATELIER 最复杂。
这次没有页面参考图,只给 6 张大都会博物馆开放图片和一段产品说明。模型要自己设计项目总览、Moodboard、定位评论、版本审批和发布预览,还要实现创意总监、设计师、客户三种权限。
gpt-5.6 sol-high:
kimi k3:
DeepSeek V4 Flash Vision Exp:
GPT 做得最像成熟的创意工作室产品,品牌主视觉很强。Kimi 的素材墙和权限信息最直观。DeepSeek 更紧凑,项目、版本和活动记录一屏就能读完。
02、opendesign中的公平对比结果
DeepSeek 比 GPT 快 43.4%,价格差距更夸张。
但这里有个容易误解的地方。DeepSeek 的累计 Token 反而最高,接近 2942 万。这个数字包含 Agent 每轮工具调用时重复读取的缓存上下文,并不等于一次提示词塞了 2942 万 Token。它的输入缓存命中率达到 99.02%,所以 Token 很大,账单依然只有一块多。
这也是 Agent 测评和普通聊天测评最大的区别:模型只是变量之一,Harness 怎么管理上下文、图片和工具日志,同样会改变时间与成本。
03、最终都通过,首版差异很大
只看终版截图,会觉得三家已经没什么差距。日志给出了另一幅图景。
GPT 的首版问题最轻。THALASSA 主要是按钮高度只有 43px,SONORA 是手机地图太高、标题换行,ATELIER 是部分按钮没有达到 44px。核心流程基本都在。
Kimi 的问题更实质。SONORA 手机端地图首版只有 2px 高,整个地图几乎消失。ATELIER 里还出现了:
TypeError: route is not a function
原因是一个参数名遮蔽了全局路由函数。代码已经修好后,浏览器缓存又加载了旧 JavaScript,看起来像"修复失败"。最后关闭缓存强制刷新,错误才消失。
DeepSeek 的自我修复能力最让我意外。THALASSA 首次加载时图表路径是空的,"全部"海域按钮也没有事件;ATELIER 构建阶段出现过两处 JavaScript 语法错误。它自己运行页面、读取控制台、用 node --check 定位,最终全部修通。
所以这轮真正拉开差距的,是首版可靠性和修复成本。GPT 更像一个经验稳定的设计工程师,DeepSeek 像速度很快、愿意反复自查的新人,Kimi 能把复杂产品做完整,但浏览器闭环对它尤其重要。
04、OpenDesign 到底带来了什么
我还用同一个 GPT 模型,在 Codex 原生 Harness 下把三道题又跑了一遍。
结果同样是 3/3 通过,但时间从 1 小时 15 分降到 43 分 34 秒,累计 Token 从 2107 万降到 699 万,API 等价成本也减少了一半左右。
OpenDesign 的核心价值是把设计任务变成一套可审查的交付流程:先建立设计系统,再生成页面,保存首版快照,用浏览器检查桌面和手机,记录缺陷,完成一轮修复,最后留下截图、指标和验收报告。
Codex 原生更轻,执行更快,ATELIER 甚至做出了更大胆的荧光绿 Moodboard。OpenDesign 更规整、更可追溯,适合团队协作、交付和复盘。
从日志看,OpenDesign 也有工程成本。视觉分析工具超时后,Kimi 改成直接读取 PNG,完整 base64 被写进事件流,ATELIER 日志膨胀到约 9MB。三家任务结束后都出现过 CodeGraph 子进程没有退出,模型已经完成,外层脚本还在等。
这些问题提醒我,视觉闭环也需要工程化:截图应该按引用传递,日志需要控制体积,模型完成时间和基础设施收尾时间应该分开记录。
05、Claude design之外的我的选择
如果追求首版稳定和整体审美,我会优先 GPT。
如果追求速度、价格和足够好的最终完成度,DeepSeek 是这轮最惊喜的选择。三道复杂任务一共一块三,已经有能力进入真实设计原型工作流。
如果你已经在使用 Kimi Coding 订阅,Kimi 同样能完成复杂产品,建议给它配上严格的浏览器验收和一轮修复。
这轮实验之后,我对"多模态能力"的理解也变了。真正值得比较的单位,已经从一个模型,变成了:
模型 + Harness + 视觉验证 + 修复闭环。
会看图只是起点。能把画面变成可运行、可交互、可验收的产品,才算真正开始懂设计。