如何使用llm 制作多模态

首先将任何非字符的序列信息使用特殊n个token 编码。

具体编码方法以图像为例子说明:

将固定尺寸图像如256256 的图像分割为16 16 的子图像块。

将已知的所有图像数据都分割后进行str将其看做是一个长的字符,而后去重后方式一个词表。

使用特殊1024 个token 表示该词表。由于词表远远大于该特殊token 的个数,必须使用 多个位的特殊token 表示,例如

使用两位 token 表示 能 1024*1024 词 可以不断的 累乘 直到大于词表大小 固定使用 这些位的token 且 小的要前面填充0 token。

例如 0,0,1023 表示一个子图。这样就可以使用 1024 个token 表示词表。

这样将整个数据集和特殊token 建立映射关系。只要设计一个神经网络学习整个映射关系,就能实现任意图像和特殊token之间的转换。

反过来任意特殊token 也能转换为任意图像。

通过上面的例子可以同样的将任务声音进行转换。

也可以将任意视频信息进行转换。

总之只要数据量足够就能完全模拟任何信息。且能通过文字控制任何信息的生成。

当前是如何制作两个完全有效学习特殊token和这些信息的互转的神经网络。

相关推荐
㱘郳4 分钟前
Python开发 Django和DRF框架 推荐部分B站视频
开发语言·python·django
ding_zhikai4 分钟前
【Web应用开发笔记】Django笔记8:用户账户相关功能
笔记·后端·python·django
Mr数据杨4 分钟前
【Dv3Admin】Django动态配置首页仪表盘
python·django·sqlite
cnnews6 分钟前
在AWS Lambda上部署 tokenizers
python·云计算·numpy·aws·lambda·onnxruntime·tokenizers
清水白石0087 分钟前
Python 虚拟环境完全指南:venv、virtualenv、conda、pipenv 深度对比与实战选择
python·conda·virtualenv
咚咚王者11 分钟前
人工智能之语言领域 自然语言处理 第二章 语言学基础
人工智能·自然语言处理
茗创科技11 分钟前
Molecular Psychiatry|将言语模式与情感性及精神病性障碍中的脑结构联系起来:一种整合性的自然语言处理方法
人工智能·自然语言处理
明月(Alioo)18 分钟前
手撕 Agent 教程 - 打造一个轻量级个人智能助手
python·ai
阿部多瑞 ABU18 分钟前
Python爬虫实战:话本小说网通用爬虫开发指南
开发语言·爬虫·python
杜子不疼.20 分钟前
Python+AI 实战:搭建属于你的智能问答机器人
人工智能·python·机器人