Solon AI 开发学习8 - chat - Vision(理解)图片、声音、视频

理解(或感知)多媒体内容的能力,需要大模型支持

1、理解图片(图像)

就是把图片和提示语一起提交给大模型。需要用到 Image 接口

接口 描述
Image.ofUrl(String) 根据 url 创建 Image
Image.ofBase64(String) 根据 base64 String 创建 Image
Image.ofBase64(byte[]) 根据 base64 byte\[\] 创建 Image

示例(有些模型需要提交 url ,有些需要提交 b64。按模型要求使用):

java 复制代码
chatModel.prompt(ChatMessage.ofUser("这个图上有人像吗?", 
                    Image.ofUrl("http://.../demo.jpg")))
            .call();

2、理解声音(音频)

就是把声音和提示语一起提交给大模型。需要用到 Audio 接口

接口 描述
Audio.ofUrl(String) 根据 url 创建 Audio

示例:

java 复制代码
chatModel.prompt(ChatMessage.ofUser("这里讲了什么?", 
                    Audio.ofUrl("http://.../demo.jpg")))
            .call();

3、理解视频

就是把视频和提示语一起提交给大模型。需要用到 Video 接口

接口 描述
Video.ofUrl(String) 根据 url 创建 Video

示例:

java 复制代码
chatModel.prompt(ChatMessage.ofUser("这里讲了什么?", 
                    Video.ofUrl("http://.../demo.jpg")))
            .call();
相关推荐
是隼人几秒前
buuctf-pwn pwnable_start(ret2shellcode)题解(学习过程持续更新)
c语言·学习·安全·pwn入门·ctf入门
HIT_Weston2 分钟前
205、【Agent】【OpenCode】TUI 内部:.tsx 与 .ts 的分界线
人工智能·agent·opencode
武子康4 分钟前
中文 Prosody-Aware Eval:从四象限样本到可诊断的实时语音评测
人工智能·llm·agent
万年咸鱼5 分钟前
Java BufferedInputStream 详解:原理、用法与实战
java·开发语言·python
Wang's Blog6 分钟前
Vibe Coding一人即团队系列61: AI驱动PPT全自动生成实战——配图集成、模板定制与多源内容适配
人工智能·powerpoint
my05927 分钟前
跳出单一信息工具局限:奥米豆构建认知与心智并行的学习范式
大数据·人工智能·python·学习
俊哥V7 分钟前
每日 AI 研究简报 · 2026-09-04
人工智能·ai
漂着的圆木9 分钟前
GLM-5.3-Flash 接入 Agent Loop:图片验收别只查 OCR
人工智能·计算机视觉·aigc·ai agent
β添砖java11 分钟前
深度学习30双向循环神经网路、机器翻译数据集、序列到序列学习、束搜索
人工智能·深度学习
俊哥V12 分钟前
AI 今日研究简报 · 2026-09-05
人工智能·ai