dify 图片提取文字

1.LLM必须支持视觉

LLM必须要本身支持视觉,然后是dify中的设置。

添加LLM的时候必须开启

如果是已经添加的模型,可以修改设置

点击后就可以改了。

工作流编排的时候可以查看

2.编排节点

比较简单。一个LLM节点就行了

LLM节点设置,必须使用支持视觉的LLM

开启LLM节点的视觉功能

可以是多张图片,但是测试的时候不要使用同一张图片,实测发现使用同一张图片的话没有作用,像这样

使用不同的图片就没问题

或者改成迭代的方式。

相关推荐
IT_陈寒5 小时前
Vue 这个响应式陷阱,我的头发都掉没了
前端·人工智能·后端
码农5995 小时前
AI Agent 能力扩展的真相:Skill、MCP 和插件不是三选一
人工智能
问天_观心5 小时前
大模型训练与推理优化(二)
人工智能·深度学习·学习·大模型·transformer
欣欣之王来了5 小时前
AI合规专项:AI算法透明度的合规要求
人工智能·算法
threerocks5 小时前
【FDE 实战课|第 01 讲】从 Palantir 到 OpenAI:FDE 的来历与全球版图
人工智能·aigc·ai编程
果霸大叔5 小时前
做了六年 K8s,我重新理解了 Agent Harness:都是把"工程化"抽离出来,让开发者专心写业务
人工智能
甲维斯5 小时前
不错不错!GPT6.1Sol的测试结果来了!
人工智能
threerocks5 小时前
【FDE 实战课|第 02 讲】为什么模型越强,越需要有人进现场
人工智能·aigc·ai编程
木头科技5 小时前
【AI 工程化第五篇】Spring AI Agent 生产治理实战:限流、熔断、降级、灰度、多模型路由和安全边界
人工智能·安全·spring
陆卿之6 小时前
Java对接DeepSeek
java·开发语言·人工智能