28 多模态(Multimodal)

多模态(Multimodal)

什么是多模态?

传统 LLM 只能处理文本,多模态模型(Multimodal / Vision Language Model,VLM)能同时理解多种输入类型:

类型 说明 代表模型
文本 + 图像 看图说话、图像分析 LLaVA、Qwen-VL、GPT-4o
文本 + 音频 语音识别 + 对话 Whisper + LLM
文本 + 视频 视频理解 Gemini 1.5

图像如何传给模型?

模型 API 不能直接收文件,图像有两种传递方式:

方式一:URL(模型从网上拉取图像)

复制代码
https://example.com/image.jpg

方式二:Base64(把图片编码成字符串,嵌进请求体)

复制代码
data:image/jpeg;base64,/9j/4AAQSkZJRgABA...
base64 编码
py 复制代码
import base64

with open("image.jpg", "rb") as f:
    data = base64.b64encode(f.read()).decode("utf-8")

url = f"data:image/jpeg;base64,{data}"

LangChain 封装了这两种方式,通过 HumanMessage 的 content 字段传入结构化列表:

py 复制代码
from langchain_core.messages import HumanMessage

message = HumanMessage(content=[
    {"type": "image_url", "image_url": {"url": "https://..."}},
    {"type": "text", "text": "这张图里有什么?"},
])

示例代码

py 复制代码
def ask_vision(llm: ChatOpenAI | ChatOllama, image_url: str, question: str):
    messages = [
        HumanMessage(
            content=[
                {"type": "image_url", "image_url": {"url": image_url}},
                {"type": "text", "text": question},
            ]
        )
    ]
    result = llm.invoke(messages)
    return result.content

def main():
    env = validate_env()
    if not env:
        return
    _, _, _, embedding_api_key, embedding_base_url, _ = env

    local_llm = ChatOllama(model="llava:7b")

    cloud_llm = ChatOpenAI(
        model="Qwen/Qwen3-VL-8B-Instruct",
        api_key=embedding_api_key,
        base_url=embedding_base_url,
    )
    q_arr = ["有什么颜色?", "有几个物体?"]
    for q in q_arr:
        image_url = describe_image(image_path)
        print(ask_vision(cloud_llm, image_url, q))
相关推荐
Web3&Basketball2 天前
用 SGLang 决策端点做毫秒级 Agent 路由
python·大模型·agent·强化学习·多模态·推理
EW Frontier4 天前
【多模态 ISAC】USRP + 28 GHz 相控阵 + RealSense:这套毫米波通感一体原型把 UE 定位做到了 0.30 米【文末附代码链接】
多模态·usrp·realsense·相控阵·isac(通感一体化)
audyxiao0016 天前
让大语言模型先读懂外部事件:一种文本增强与正则扩散对齐的多模态时序预测框架
人工智能·语言模型·多模态·时间序列
做cv的小昊7 天前
【World Model】π0.5:a Vision-Language-Action Model with Open-World Generalization
人工智能·算法·机器学习·大模型·多模态·vla·世界模型
七夜zippoe8 天前
多模态 Agent 入门:让 Agent 看懂图片、听懂语音、生成内容
ai·agent·多模态·看懂·听懂·生成内容
东姬AI16 天前
语音抢着实时,视频也抢着实时:两条赛道同时冲刺,交汇点却还差一步
ai·数字人·多模态·视频生成·语音大模型
医嘉研-Meta|生信|一对一指导16 天前
医嘉研:单细胞CNV异质性锁定膀胱癌恶性亚型:多模态AI病理模型与RTN3/JAK2/STAT3/糖酵解轴的耐药机制解析
多模态·医学·论文辅导收费·多少钱·公开行情大致·人工润色千元
码哥字节18 天前
DeepSeek 视觉 API 刚上线:单张图 0.001 元,Agent 终于能看图
vision·多模态·deepseek·agent skills
oscar99918 天前
用 Opik 记录多模态追踪:图像、视频、音频附件的完整指南
多模态·opik
星云_byto19 天前
大模型测评:从最新出的DeepSeekV4.1模型看这19项指标
chatgpt·agent·多模态·codex·deepseek·大模型测评·opus-4.8