【StableDiffusion】Embedding 底层原理,Prompt Embedding,嵌入向量

Embedding 是什么?

Embedding 是将自然语言词汇,映射为 固定长度 的词向量 的技术

· 说到这里,需要介绍一下 One-Hot 编码 是什么。

· One-Hot 编码 使用了众多 5000 长度的1维矩阵,每个矩阵代表一个词语。

· 这有坏处,它不仅计算量更大,而且,它是 不可移植的,因为每个词汇表中,每个 One-Hot 矩阵对应的 prompt 都不同。

· Embedding 能够将 One-Hot 编码的高维稀疏向量(矩阵) 转化为 低维连续的向量(矩阵),请看下面的例子

来看看,降维算法能够将这些被 Embedding 转化了的向量在 2维 坐标系上展现成什么样:

很明显,意思越是不相同的词语,他们的向量距离在二维平面上也相距越远

越是意思相近的词语(cat,猫;kitten,小猫),它们的向量在二维平面上的距离越近

而且,有语义关联的一些词语,它们的向量也是有特殊的数学关系的:

Embedding 将 text → vector 的具体过程

1.首先对句子进行处理,将句子切成单独的词语

2.被切的词语以 One-Hot 的编码格式存储

3.让代表你的词语的 One-Hot 编码的矩阵 和 嵌入矩阵(图中的矩阵E) 相乘,得到这句话的嵌入向量。

请注意,"嵌入矩阵"是提前被训练好的,也就是 Embedding 处理器 的本体。

在相乘之后,我们的自然语言句子的向量就从 4x5000的矩阵 → 4x128的矩阵

也就是,从 高维稀疏矩阵 → 低维稠密矩阵

这就是 Embedding 的作用机制!

相关推荐
AI小白龙*2 小时前
LLM大模型实战 —— DB-GPT阿里云部署指南
阿里云·大模型·llm·prompt·embedding·ai大模型·大模型部署
linmoo198619 小时前
检索增强生成RAG系列3--RAG优化之文档处理
embedding·向量数据库·rag·pypdf·文档分块·pdfminer
yubinCloud2 天前
【Text2SQL 论文】MCS-SQL:利用多样 prompts + 多项选择来做 Text2SQL
数据库·语言模型·自然语言处理·prompt·text2sql
fengbeely2 天前
百度智能云升级:接入33个大模型,Llama 2引领创新,103个Prompt模板上线
百度·prompt·llama
编程╱小白╲2 天前
基于星火大模型的群聊对话分角色要素提取挑战赛-Lora微调与prompt构造
python·语言模型·prompt
xuxu11162 天前
AI作画Prompt不会写?Amazon Bedrock Claude3.5来帮忙
chatgpt·大模型·prompt·claude·amazon·亚马逊云科技·amazonbedrock
极客Kimi3 天前
基于Embedding实现超越ES的高级搜索
大数据·elasticsearch·embedding
爱写代码的派大星4 天前
this.$prompt 提示框增加文本域并修改文本域高度
前端·javascript·prompt
代码之光_19804 天前
探索LangChain Prompt模板:构建高效语言模型交互的秘诀
语言模型·langchain·prompt
kcarly4 天前
Prompt 提示词工程:翻译提示
笔记·深度学习·自然语言处理·prompt