【大模型入门系列】之多模态大模型综述

文章目录

参考:MM-LLMs综述

  • 编码器(Modality Encoder):将多模态的数据编码成向量空间特征,该模块通常是单独进行预训练的,典型的方法有基于CNN的ResNET,基于Transformer的ViT等。
  • 输入投影层(Input Projector):将模态编码器的输出映射到LLM的输入特征空间的适配层,一般模型结构比较简单,不同的多模态模型一般是随机初始化该模块的参数做冷启训练。典型的网络层:MLP,Cross-Attention等
  • LLM主干网络(LLM Backbone):LLM是经过预训练的模型,一般还要串联多个模块继续做Post-Pretrain和微调,使得模型能识别多模态的特殊token和多模态的特征输入。
  • 输出投影层(Output Projector):将LLM生成的数据,映射成Modality Generator 可理解的特征空间,一般是简单的Transformer层或MLP层。
  • 模态生成器(Modality Generator):多模态的生成器,最终输出多模态的结果如图像、语音、视频等。模型基本都是基于LDM(Latent Diffusion Models)的衍生模型,如图片领域的Stable Diffusion方法。

TBD

敬请期待

相关推荐
恋猫de小郭1 分钟前
KotlinLLM 开源 ,一个可以在运行时自己生成永久 Kotlin 代码的 Agent 库
android·前端·人工智能
EDA365电子论坛5 分钟前
AI 智能管控差分线间距规范,消除内外间距统一导致耦合失效问题
人工智能
武子康5 分钟前
OpenAI Tibo:同样的 Rate Card,为什么更强的 Sol 反而更快耗尽 Codex 限额
人工智能·chatgpt·openai
北冥you鱼10 分钟前
深入解析 DEX 项目池流动性设计原理:从恒定乘积到集中流动性
人工智能·区块链
微学AI12 分钟前
一款童年游戏对超级智能体应用开发的启示 — 从《武林群侠传》看 Agent 架构设计的“江湖智慧“
人工智能·游戏·agent
OBiO201316 分钟前
AAV心脏靶向选型与HFpEF治疗新策略:Sub1靶点从发现到验证全解析
人工智能
xx_xxxxx_19 分钟前
AI基本结构12-lstm实现nlp
人工智能·pytorch·rnn·lstm
IT_陈寒20 分钟前
Redis踩了个大坑,原来DEL命令也会卡住整个实例
前端·人工智能·后端
狂师23 分钟前
AI 测试提效 | 告别手动抓取元素,分享我的 ui-page-parser + Skill UI 自动化提效方案
人工智能·agent·测试
七牛云行业应用24 分钟前
Codex Computer Use 完全指南:让 AI 接管你的桌面(含 Windows 版)
人工智能·windows