长期以来,我在OpenCode中使用DeepSeek、glm这些开源模型的时候,总有一种深深的无力感,就是这些模型虽然很强,但它是纯文本的,这直接导致AI模型无法解决我的一些包含识图场景的问题。
于是随手给OpenCode开发了一个多模态插件,给当前聊天上下文增加一个tool,当模型识别到要识别图片的时候且当前的模型是需要识图的列表(可以自己配置),就会调用这个tool去调用一个可以识图的模型,并将结果返回到上下文正文里面,从而间接实现识图效果,这个插件已经开源,目前还没通过官方的生态验证,暂时只能下载源码丢进特定的OpenCode文件夹来开启。
说那么多也没用,先给大家端上来吧: github.com/cipherTing/...
遇到问题建议直接在github issues里面发个issues就行了,有什么疑问或者需要讨论的可以在评论区交流

