前段时间深度体验了一下 K3,各方面都表现不错,前端尤其突出,审美很好,3D 建模方面也很强。
今天又要把 2.8T 的 K3 拉出来溜溜!看看在这个问题上的表现如何。
下面我就说一下前因后果以及测试过程!

起因是,我想在 OpenCode 中使用 Ox 模型,但是软件一直都在加载中,无法使用。
然后又引出了一连串问题,比如内存爆满,硬盘爆满!
得亏有其它牛逼的 Agent,否则我这台电脑基本上就废了!
为了分析这个问题,我动用了好多 Agent(Model)。
Claude 用上了,ZCode 用上了,Codex 也用上了,DeepSeek V4 模型也用上了。结果我都在之前的文章中分享过了!
今天试试 KimiCode + K3!

我的问题是这样的:
我本地有一个 OpenCode,可以选择一个免费的 Ox 模型,但是当我发送消息之后,一直都在加载中,我怀疑是这个软件有问题了,我的网络是正常的,它的 GUI 版本也是正常的。你帮我排除一下是什么问题。
这个问题的考点是"用户目录"!但是题目中都是隐含条件,完全没有点出这个问题。需要模型自己去对比分析找到这个关键点。
它花了一个小时得出的结论如下:

它认为这是一个 OpenCode 的已知 Bug。是 Bug 没错,但是否已知我不确定。另外它下面引用的 Bug 信息和今天的 Bug,并不是同一个 Bug。
所以 K3 的分析是错的,而且全错!
它整个消耗的时间比较久,消耗的 Token 也不少(99 元的套餐)。

很可惜,结果是错的。根据它的建议,完全无法解决这个问题!
我看了它的分析过程。
它是复现了请求无响应这个现象。但是当它透过现象看本质的时候,看错了。
它一直把注意力聚焦在了网络问题上,招呼都没打直接把我代理杀了,Claude 账号差点被搞死了。当时 Codex 和 Claude 还登在干活呢......太危险了!
然后它的第二个方向是,直接去抓了开发版来测试!
因为分析的方向错了,所以最终只是浪费时间和浪费 Token 而已。
K3 的前端能力是真的强,审美很好,做 PPT 估计全网最佳了。其实大部分后端也没啥问题。但是针对这种系统和网络的分析能力还是非常弱的。
我看它在收集基本信息的时候明明读取到了日志,按理说应该能看到一些端倪的,实际上并没有,它只是看了,但是没看出关键。
Opus 5 看了一眼日志,它就知道和"用户目录"有关系,直接做了 A/B 对照测试,一把就锁定了关键问题。
这个问题,我准备在电脑上修复了,以后就没法真实场景测试了。目前测试了四五个模型,还是O哥,Opus5 最犀利!
完全失败的选手有DeepSeek V4Flash,K3,GPT5.6 !
这个问题的复杂性在于"隐藏条件"!
现实中的问题,提问者,往往不知道问题的本质,所以才要提问。所以聪明的模型,可以通过现象分析出本质,这才是真正的智能。 而有些模型只是走个流程,所以它一旦走路了,就再也得不到答案了。
我之前一篇文章中也强调过,模拟环境下的基准数据和真实环境下的体验网往往差距很大,主要是真实环境中的"噪声"很多,而且不是多一点点,可能多好几个数量级,会极大的分散模型的注意力。所以,基准是仅供产考,只是最基本的一个参考!基准之外,还有很多东西。
另外一点K3 如此大的参数,最终也没解决。所以大模型也未必真的"聪明"。
一切还是要以现实状况为准!每个模型都有它特定的能力范围。