OpenCode问题,让Kimi K3 也测一波吧!

前段时间深度体验了一下 K3,各方面都表现不错,前端尤其突出,审美很好,3D 建模方面也很强。

今天又要把 2.8T 的 K3 拉出来溜溜!看看在这个问题上的表现如何。

下面我就说一下前因后果以及测试过程!

起因是,我想在 OpenCode 中使用 Ox 模型,但是软件一直都在加载中,无法使用。

然后又引出了一连串问题,比如内存爆满,硬盘爆满!

得亏有其它牛逼的 Agent,否则我这台电脑基本上就废了!

为了分析这个问题,我动用了好多 Agent(Model)。

Claude 用上了,ZCode 用上了,Codex 也用上了,DeepSeek V4 模型也用上了。结果我都在之前的文章中分享过了!

今天试试 KimiCode + K3!

我的问题是这样的:

我本地有一个 OpenCode,可以选择一个免费的 Ox 模型,但是当我发送消息之后,一直都在加载中,我怀疑是这个软件有问题了,我的网络是正常的,它的 GUI 版本也是正常的。你帮我排除一下是什么问题。

这个问题的考点是"用户目录"!但是题目中都是隐含条件,完全没有点出这个问题。需要模型自己去对比分析找到这个关键点。

它花了一个小时得出的结论如下:

它认为这是一个 OpenCode 的已知 Bug。是 Bug 没错,但是否已知我不确定。另外它下面引用的 Bug 信息和今天的 Bug,并不是同一个 Bug。

所以 K3 的分析是错的,而且全错!

它整个消耗的时间比较久,消耗的 Token 也不少(99 元的套餐)。

很可惜,结果是错的。根据它的建议,完全无法解决这个问题!

我看了它的分析过程。

它是复现了请求无响应这个现象。但是当它透过现象看本质的时候,看错了。

它一直把注意力聚焦在了网络问题上,招呼都没打直接把我代理杀了,Claude 账号差点被搞死了。当时 Codex 和 Claude 还登在干活呢......太危险了!

然后它的第二个方向是,直接去抓了开发版来测试!

因为分析的方向错了,所以最终只是浪费时间和浪费 Token 而已。

K3 的前端能力是真的强,审美很好,做 PPT 估计全网最佳了。其实大部分后端也没啥问题。但是针对这种系统和网络的分析能力还是非常弱的。

我看它在收集基本信息的时候明明读取到了日志,按理说应该能看到一些端倪的,实际上并没有,它只是看了,但是没看出关键。

Opus 5 看了一眼日志,它就知道和"用户目录"有关系,直接做了 A/B 对照测试,一把就锁定了关键问题。

这个问题,我准备在电脑上修复了,以后就没法真实场景测试了。目前测试了四五个模型,还是O哥,Opus5 最犀利!

完全失败的选手有DeepSeek V4Flash,K3,GPT5.6 !

这个问题的复杂性在于"隐藏条件"!

现实中的问题,提问者,往往不知道问题的本质,所以才要提问。所以聪明的模型,可以通过现象分析出本质,这才是真正的智能。 而有些模型只是走个流程,所以它一旦走路了,就再也得不到答案了。

我之前一篇文章中也强调过,模拟环境下的基准数据和真实环境下的体验网往往差距很大,主要是真实环境中的"噪声"很多,而且不是多一点点,可能多好几个数量级,会极大的分散模型的注意力。所以,基准是仅供产考,只是最基本的一个参考!基准之外,还有很多东西。

另外一点K3 如此大的参数,最终也没解决。所以大模型也未必真的"聪明"。

一切还是要以现实状况为准!每个模型都有它特定的能力范围。

相关推荐
长三角智造观察2 小时前
中小制造ERP+MES选型避坑:对接集成VS原生一体化,深度对比TCO与落地痛点
大数据·人工智能·制造
一水鉴天8 小时前
映射、哈希表与哈斯图:计算机科学的三种基线 20261003(元宝)
开发语言·人工智能
198******126348 小时前
2026 企业 AI 办公产品选型指南:从场景匹配判断工具价值
人工智能
玫瑰互动GEO8 小时前
GEO优化学习九级模型:开发者从认知层切入
人工智能·ai·ai搜索·gem·生成式引擎优化·gem优化
海绵宝宝转agent8 小时前
learn-claude-code第1-5章开源学习笔记分享
人工智能·笔记·python·学习
每天都要写算法(努力版)8 小时前
【行业前沿报告】DAgger:让智能体在自己走到的状态上学习
人工智能·学习·机器学习
liron719 小时前
智能实体演化系统的统一性概念
人工智能·深度学习·神经网络
呆萌很9 小时前
常用骨干网络预训练输入尺寸
人工智能
Yolanda_20229 小时前
19.神经网络-最大池化的使用
人工智能·深度学习·神经网络
W***25929 小时前
2026 企业 AI 办公平台选型指南:可完成全链路任务的 AI 工具评估
人工智能