介绍下本人开发的OpenCode开源多模态插件——analyze-image

长期以来,我在OpenCode中使用DeepSeek、glm这些开源模型的时候,总有一种深深的无力感,就是这些模型虽然很强,但它是纯文本的,这直接导致AI模型无法解决我的一些包含识图场景的问题。

于是随手给OpenCode开发了一个多模态插件,给当前聊天上下文增加一个tool,当模型识别到要识别图片的时候且当前的模型是需要识图的列表(可以自己配置),就会调用这个tool去调用一个可以识图的模型,并将结果返回到上下文正文里面,从而间接实现识图效果,这个插件已经开源,目前还没通过官方的生态验证,暂时只能下载源码丢进特定的OpenCode文件夹来开启。

说那么多也没用,先给大家端上来吧: github.com/cipherTing/...

遇到问题建议直接在github issues里面发个issues就行了,有什么疑问或者需要讨论的可以在评论区交流

相关推荐
唐老板2 小时前
Meta Muse Code 发布:低价杀入编程
ai编程
xcLeigh2 小时前
编程语言的 AI 友好度排名:Python、JavaScript、TypeScript 谁更适合 AI 辅助
javascript·人工智能·python·ai·typescript·ai编程
寒蝉1284 小时前
给 Kimi Code 装个「任务完成提醒」,再也不怕回来才发现任务早跑完了
ai编程
lifallen5 小时前
Emdash 拆解:多 Agent 并行开发桌面端的实现思路,兼谈 ACP 与 A2A
人工智能·学习·ai·ai编程
南方程序猴6 小时前
我把 Node.js、npm 和 Codex CLI 全卸了,重新测了一遍 Windows 一键安装
人工智能·gpt·ai·ai编程
南方程序猴7 小时前
Windows一键安装Codex所有环境
人工智能·gpt·ai·chatgpt·ai编程
Hector_zh9 小时前
逐浪 · 第十三篇 TRAE Work 实战:分分钟让AI"记住"你是谁——一次跨会话长期记忆的完整实践
人工智能·ai编程·vibecoding
leeyi9 小时前
Memory 三层设计:为什么 [“session“,id] 最后写成了四元组(第78篇-E64)
aigc·agent·ai编程