如何使用llm 制作多模态

首先将任何非字符的序列信息使用特殊n个token 编码。

具体编码方法以图像为例子说明:

将固定尺寸图像如256256 的图像分割为16 16 的子图像块。

将已知的所有图像数据都分割后进行str将其看做是一个长的字符,而后去重后方式一个词表。

使用特殊1024 个token 表示该词表。由于词表远远大于该特殊token 的个数,必须使用 多个位的特殊token 表示,例如

使用两位 token 表示 能 1024*1024 词 可以不断的 累乘 直到大于词表大小 固定使用 这些位的token 且 小的要前面填充0 token。

例如 0,0,1023 表示一个子图。这样就可以使用 1024 个token 表示词表。

这样将整个数据集和特殊token 建立映射关系。只要设计一个神经网络学习整个映射关系,就能实现任意图像和特殊token之间的转换。

反过来任意特殊token 也能转换为任意图像。

通过上面的例子可以同样的将任务声音进行转换。

也可以将任意视频信息进行转换。

总之只要数据量足够就能完全模拟任何信息。且能通过文字控制任何信息的生成。

当前是如何制作两个完全有效学习特殊token和这些信息的互转的神经网络。

相关推荐
AI 嗯啦26 分钟前
SQL详细语法教程(三)mysql的函数知识
android·开发语言·数据库·python·sql·mysql
databook34 分钟前
把数学对象画出来:Manim Mobject类库速查手册
python·数学·动效
图灵学术计算机论文辅导1 小时前
傅里叶变换+attention机制,深耕深度学习领域
人工智能·python·深度学习·计算机网络·考研·机器学习·计算机视觉
ruleslol1 小时前
python30-正则表达式
python·正则表达式
vincent_hahaha2 小时前
关于simplifyweibo_4_moods数据集的分类问题
python
三年呀3 小时前
**标题:发散创新之力,探索隐私计算的未来**隐私计算,作为当下数字化时代的热门话题,正受
python
R-G-B3 小时前
OpenCV Python——报错AttributeError: module ‘cv2‘ has no attribute ‘bgsegm‘,解决办法
人工智能·python·opencv·opencv python·attributeerror·module ‘cv2‘·no attribute
DavieLau4 小时前
C#项目WCF接口暴露调用及SOAP接口请求测试(Python版)
xml·服务器·开发语言·python·c#
数据知道4 小时前
机器翻译:模型微调(Fine-tuning)与调优详解
人工智能·自然语言处理·机器翻译
白露与泡影4 小时前
Spring容器初始化源码解析
java·python·spring