【大模型入门系列】之多模态大模型综述

文章目录

参考:MM-LLMs综述、

  • 编码器(Modality Encoder):将多模态的数据编码成向量空间特征,该模块通常是单独进行预训练的,典型的方法有基于CNN的ResNET,基于Transformer的ViT等。
  • 输入投影层(Input Projector):将模态编码器的输出映射到LLM的输入特征空间的适配层,一般模型结构比较简单,不同的多模态模型一般是随机初始化该模块的参数做冷启训练。典型的网络层:MLP,Cross-Attention等
  • LLM主干网络(LLM Backbone):LLM是经过预训练的模型,一般还要串联多个模块继续做Post-Pretrain和微调,使得模型能识别多模态的特殊token和多模态的特征输入。
  • 输出投影层(Output Projector):将LLM生成的数据,映射成Modality Generator 可理解的特征空间,一般是简单的Transformer层或MLP层。
  • 模态生成器(Modality Generator):多模态的生成器,最终输出多模态的结果如图像、语音、视频等。模型基本都是基于LDM(Latent Diffusion Models)的衍生模型,如图片领域的Stable Diffusion方法。

TBD

敬请期待

相关推荐
小范的技术工坊几秒前
RAG完整链路拆解
大模型
Summer-Bright3 分钟前
深度 | 谷歌Gemini 4 Argon单次输出100万Token:长输出是智能体刚需,先给防御者不给攻击者才是新玩法
人工智能·安全·ai
梦帮科技4 分钟前
多任务权重流形融合:SLERP 球形线性插值、DARE 稀疏剪枝与多专家模型融合落地
人工智能·深度学习·算法·机器学习·tensorflow·聚类·剪枝
合调于形8 分钟前
Xinxngb xnrxim chanyes《新兴信息产业》词条汉语拼音字母标调拼写实测案例
人工智能·自然语言处理·人机交互·语音识别·学习方法
汤姆yu9 分钟前
GPT‑6 Astra大模型综述
gpt·ai·大模型
workflower11 分钟前
世界模型向产业上游发掘的热点
人工智能·机器学习·机器人·云计算·无人机
Yolanda_202214 分钟前
17.卷积操作
人工智能·深度学习
`流年づ15 分钟前
卷积核与反卷积知识补充
人工智能·深度学习·计算机视觉
百无聊赖是也非也21 分钟前
当 AI 闯入理论物理:终结算力困境,重塑科研边界
人工智能
szxinmai主板定制专家22 分钟前
RK3568+FPGA+CODESYS异构控制方案:赋能半导体设备与工业自动化升级
人工智能·fpga开发·自动化·rk3576·半导体设备