如何使用llm 制作多模态

首先将任何非字符的序列信息使用特殊n个token 编码。

具体编码方法以图像为例子说明:

将固定尺寸图像如256256 的图像分割为16 16 的子图像块。

将已知的所有图像数据都分割后进行str将其看做是一个长的字符,而后去重后方式一个词表。

使用特殊1024 个token 表示该词表。由于词表远远大于该特殊token 的个数,必须使用 多个位的特殊token 表示,例如

使用两位 token 表示 能 1024*1024 词 可以不断的 累乘 直到大于词表大小 固定使用 这些位的token 且 小的要前面填充0 token。

例如 0,0,1023 表示一个子图。这样就可以使用 1024 个token 表示词表。

这样将整个数据集和特殊token 建立映射关系。只要设计一个神经网络学习整个映射关系,就能实现任意图像和特殊token之间的转换。

反过来任意特殊token 也能转换为任意图像。

通过上面的例子可以同样的将任务声音进行转换。

也可以将任意视频信息进行转换。

总之只要数据量足够就能完全模拟任何信息。且能通过文字控制任何信息的生成。

当前是如何制作两个完全有效学习特殊token和这些信息的互转的神经网络。

相关推荐
黄昏恋慕黎明7 分钟前
博客论坛技术迭代
python·pytest
我叫汪枫9 分钟前
RAG 进阶:切分、检索、重排序,以及它和 Agent、微调、MCP 都是什么关系
开发语言·python
冰芒芒17 分钟前
构建你的第一个 Agent 项目
python
gf132111117 分钟前
【python_发送飞书卡片消息_直接组装JSON格式发送卡片】
python·json·飞书
lzqrzpt27 分钟前
临沂LED驱动电源制造工艺解析与工程选型避坑指南
python·制造
ai小陈28 分钟前
Python 3.12与CUDA 12.8镜像实战:启动GPU实例后的五项自检
开发语言·人工智能·python·深度学习·ai·gpu算力
Thomas.Sir32 分钟前
第48课:TensorFlow|TF模型线上部署入门【本地服务封装、接口快速开发】
人工智能·python·tensorflow
Bruce_Liuxiaowei34 分钟前
录屏片段无损合并:从 ffmpeg concat 原理到 Python 自动化脚本
python·ffmpeg·自动化
renzao_ai1 小时前
本地 35B 大模型部署实战:Ollama 跑 Ornith-35B 全流程
python·llama·免费ai大模型