如何使用llm 制作多模态

首先将任何非字符的序列信息使用特殊n个token 编码。

具体编码方法以图像为例子说明:

将固定尺寸图像如256256 的图像分割为16 16 的子图像块。

将已知的所有图像数据都分割后进行str将其看做是一个长的字符,而后去重后方式一个词表。

使用特殊1024 个token 表示该词表。由于词表远远大于该特殊token 的个数,必须使用 多个位的特殊token 表示,例如

使用两位 token 表示 能 1024*1024 词 可以不断的 累乘 直到大于词表大小 固定使用 这些位的token 且 小的要前面填充0 token。

例如 0,0,1023 表示一个子图。这样就可以使用 1024 个token 表示词表。

这样将整个数据集和特殊token 建立映射关系。只要设计一个神经网络学习整个映射关系,就能实现任意图像和特殊token之间的转换。

反过来任意特殊token 也能转换为任意图像。

通过上面的例子可以同样的将任务声音进行转换。

也可以将任意视频信息进行转换。

总之只要数据量足够就能完全模拟任何信息。且能通过文字控制任何信息的生成。

当前是如何制作两个完全有效学习特殊token和这些信息的互转的神经网络。

相关推荐
PythonFun5 分钟前
OCR图片识别翻译工具功能及源码
python·ocr·机器翻译
虫师c35 分钟前
Python浪漫弹窗程序:Tkinter实现动态祝福窗口教程
python·tkinter·动画效果·gui编程·弹窗效果
灯火不休时2 小时前
95%准确率!CNN交通标志识别系统开源
人工智能·python·深度学习·神经网络·cnn·tensorflow
deephub2 小时前
FastMCP 入门:用 Python 快速搭建 MCP 服务器接入 LLM
服务器·人工智能·python·大语言模型·mcp
南宫乘风2 小时前
基于 Flask + APScheduler + MySQL 的自动报表系统设计
python·mysql·flask
番石榴AI2 小时前
基于机器学习优化的主图选择方法(酒店,景点,餐厅等APP上的主图展示推荐)
图像处理·人工智能·python·机器学习
qq7422349843 小时前
Python操作数据库之pyodbc
开发语言·数据库·python
2401_841495643 小时前
【自然语言处理】轻量版生成式语言模型GPT
人工智能·python·gpt·深度学习·语言模型·自然语言处理·transformer
云和数据.ChenGuang4 小时前
tensorflow生成随机数和张量
人工智能·python·tensorflow
测试老哥5 小时前
python+requests+excel 接口测试
自动化测试·软件测试·python·测试工具·测试用例·excel·接口测试