28 多模态(Multimodal)

多模态(Multimodal)

什么是多模态?

传统 LLM 只能处理文本,多模态模型(Multimodal / Vision Language Model,VLM)能同时理解多种输入类型:

类型 说明 代表模型
文本 + 图像 看图说话、图像分析 LLaVA、Qwen-VL、GPT-4o
文本 + 音频 语音识别 + 对话 Whisper + LLM
文本 + 视频 视频理解 Gemini 1.5

图像如何传给模型?

模型 API 不能直接收文件,图像有两种传递方式:

方式一:URL(模型从网上拉取图像)

复制代码
https://example.com/image.jpg

方式二:Base64(把图片编码成字符串,嵌进请求体)

复制代码
data:image/jpeg;base64,/9j/4AAQSkZJRgABA...
base64 编码
py 复制代码
import base64

with open("image.jpg", "rb") as f:
    data = base64.b64encode(f.read()).decode("utf-8")

url = f"data:image/jpeg;base64,{data}"

LangChain 封装了这两种方式,通过 HumanMessage 的 content 字段传入结构化列表:

py 复制代码
from langchain_core.messages import HumanMessage

message = HumanMessage(content=[
    {"type": "image_url", "image_url": {"url": "https://..."}},
    {"type": "text", "text": "这张图里有什么?"},
])

示例代码

py 复制代码
def ask_vision(llm: ChatOpenAI | ChatOllama, image_url: str, question: str):
    messages = [
        HumanMessage(
            content=[
                {"type": "image_url", "image_url": {"url": image_url}},
                {"type": "text", "text": question},
            ]
        )
    ]
    result = llm.invoke(messages)
    return result.content

def main():
    env = validate_env()
    if not env:
        return
    _, _, _, embedding_api_key, embedding_base_url, _ = env

    local_llm = ChatOllama(model="llava:7b")

    cloud_llm = ChatOpenAI(
        model="Qwen/Qwen3-VL-8B-Instruct",
        api_key=embedding_api_key,
        base_url=embedding_base_url,
    )
    q_arr = ["有什么颜色?", "有几个物体?"]
    for q in q_arr:
        image_url = describe_image(image_path)
        print(ask_vision(cloud_llm, image_url, q))
相关推荐
william_yangshun7 天前
【AI Agent 实战】agent-vision-toolkit 中文版:给纯文本模型(DeepSeek)装上视觉能力
人工智能·多模态
CV山月7 天前
大模型强化学习对齐:从 RLHF 框架到 PPO 算法原理
人工智能·python·大模型·强化学习·多模态·研究生
deepseek238 天前
Google Gemini Agentic Video 上线:88% 少 token 的主动取样如何改写长视频理解
python·多模态·ai agent·gemini·视频理解
山顶夕景9 天前
【Omni】OmniGAIA: Towards Native Omni-Modal AI Agents
agent·多模态·vlm·omni·全模态
s1ckrain10 天前
【论文阅读】A Survey on Vision–Language–Action Models for Embodied AI
论文阅读·人工智能·多模态·具身智能
这张生成的图像能检测吗11 天前
(论文速读)Scaling Rectified Flow Transformers:Rectified Flow + MM-DiT 的高分辨率文生图路线
大模型·文生图·多模态·扩散模型·图像生成
新知图书13 天前
10.4 交互优化与用户体验提升
人工智能·多模态·智能体
山顶夕景15 天前
【LLM】GLM-5.3-Flash模型
大模型·llm·agent·多模态·moe
梦想的颜色15 天前
【AI科普】什么是计算机视觉:硬核科普,它和大 AI 大模型到底是什么关系
人工智能·深度学习·计算机视觉·多模态·aiagent·#vlm·ai工程实战