创作于2026.8.1
前几天,我刚分享过一个观点:个人想真正驾驭智能体,关键不只是模型,还要给它搭好一套干活的环境,也就是 Harness。
理论讲了一堆,但是一直缺少个实践案例的说明。
这次正好一起测试下。
这次不看代码,只看像不像
先看一下本次需要复刻的原始设计图。

这是本次测试使用的原始设计图,所有组合面对的是同一个任务。
这是一张完整的平台门户设计图,包含顶部导航、Banner、数字化服务入口、资讯区域,也有不少图标、背景和装饰素材。
这次测试,我们不去比较谁的代码更优雅、用了什么框架、消耗了多少Token。
标准就一个:
最终做出来的页面,到底像不像原图。
大部分测试场景都采用统一的指令,如下:
bash
<原设计图>
1比1复刻图片中的网页,直接采用html+css,不需要受限于任何框架,充分发挥你的设计能力,保证设计效果一致。 图片如果可以截取就截取,如果不方便,直接采用占位图片Lorem Picsum
连续试了三次K3,效果都不太行
最近 K3 很热,自然优先试一下。
第一组用的是 Cursor + K3,本组是唯一没有采用统一提示词的场景,只使用了:实现如图前端页面。
页面确实生成出来了,但和原设计图可以说是毫不相关。

一开始,我觉得可能是Cursor和K3的配合问题。
于是又换成 TRAE + K3 跑了一遍,比第一组好点,但不多。

为了确认,我又试了 OpenCode + K3,感觉好像又好了点,但依然一般。

连续三套工具跑下来,我心里已经开始犯嘀咕了:
K3不会也是那种榜单成绩挺漂亮,真正落到前端任务里却差点意思的"打榜选手"吧?
但我们之前实现 mac 系统复刻还可以呀。
于是,我准备换一个前端表现一直不错的模型做参照。
换成Gemini,又验证2次
我选择了 Gemini 。
这个选择不是随机的。根据我之前的使用感受,Gemini一直算是前端视觉效果比较好的模型,做网页和界面时,通常不会太难看。
这次正好拿它做一下对照。
我先后测试了2组:
-
TRAE + Gemini 3 Flash -
TRAE + Gemini 3.1 Pro
效果只能说差不多。


这样看起来,K3 好像没有什么太大问题。
那总不能这些模型都只能搞点小 case?
换到Kimi官网,K3突然又行了
接下来,我又尝试把同一个任务放到了Kimi官网。
这结果真让我有点吃惊了。

前面同样是K3,放在Cursor、TRAE和OpenCode里,结果都不理想。回到Kimi自己的产品里,页面效果却明显上了一个台阶。
后来我又测试了 ChatGPT,效果也挺棒。

这里我不准备给Kimi和ChatGPT硬排第一、第二,因为我们团队都没达成一致。
但是,看到这里,前面那个"K3是不是只会打榜"的担心,基本可以先放下了。
好的两个Case,过程有些不一样
我又回头看了一遍Kimi和GPT的执行过程。
两个效果最好的Case,都做了两件很具体的事。
第一件是切割设计图。
它们没有一直对着一张完整长图直接写代码,而是先把页面切分成不同区域,再分别分析和实现。

第二件是自动提取素材。
设计图里的图标、背景图和装饰元素,它们没有全部用代码重画,也没有找一个差不多的素材替代,而是从原始设计图里切出来,再放回页面。

自己的模型,可能还是得配自家的Harness
这次还有一个挺有意思的小感悟:
自己的模型,可能还是得配自家的Harness。
同样是K3,在几款第三方AI编程工具里的效果都不理想,回到Kimi官网以后,能力才真正发挥出来。
模型厂商可能更清楚自家模型需要怎样组织上下文,适合调用什么工具,又应该按照什么方式推进任务。
结语
不算非常严谨的一次测试,但已经很能说明 Harness 的重要性了。
不过,复杂门户页面1比1复刻的这个场景好像还有得研究,后续有所得之后再和大家分享~