dify 图片提取文字

1.LLM必须支持视觉

LLM必须要本身支持视觉,然后是dify中的设置。

添加LLM的时候必须开启

如果是已经添加的模型,可以修改设置

点击后就可以改了。

工作流编排的时候可以查看

2.编排节点

比较简单。一个LLM节点就行了

LLM节点设置,必须使用支持视觉的LLM

开启LLM节点的视觉功能

可以是多张图片,但是测试的时候不要使用同一张图片,实测发现使用同一张图片的话没有作用,像这样

使用不同的图片就没问题

或者改成迭代的方式。

相关推荐
恒知学术3 小时前
SCI 文献怎么检索?英文关键词、DOI、被引量和开放获取线索整理
人工智能·深度学习·sci·文献检索·谷歌学术·doi
greatonce3 小时前
巨益及核全球电商业财一体化方案 | 行业能力概览
人工智能
中微极客3 小时前
Veo视频生成与Gemini Agent平台集成实践
数据库·人工智能·oracle·音视频
老刘说AI3 小时前
SGLang 深度优化: Radix 缓存与复杂任务的极致吞吐
人工智能·神经网络·机器学习·缓存·架构·sglang
一包惆怅的辣条3 小时前
谈一下怎么写一个一套可复用的用例改写skill架构
自动化测试·人工智能·ai·skill
2601_958352903 小时前
语音模组选型:模拟、数字、USB、I²S接口如何取舍?AU-60 同时支持四种接口的硬件方案解析
人工智能·语音识别·dsp模组
清禾无为3 小时前
直播间还没下播,怎么快速产出短视频素材用于投流?
人工智能
wabs6664 小时前
关于文献【26ACL三篇最佳论文的具体归属?】
人工智能·文献
科技大视界4 小时前
TikTok广告素材投放工具:从官方后台到AIGC一体化矩阵构建高效投放矩阵
人工智能·矩阵·aigc