大模型从prompt到第一个token的输出过程

1. 从文字输入到输出第一个token的过程

2. 细节拆解

2.1 多头注意力(并行的关键点之一)

假定通过输入X,计算得到的Q,K,V分别为:

lua 复制代码
Q矩阵
[[1.0, 0.0, 0.0, 9.0, 0.0, 8.0]
 [0.0, 2.0, 2.0, 0.0, 6.0, 0.0]]
K矩阵
[[3.0, 0.0, 3.0, 0.0, 0.0, 5.0]
 [0.0, 4.0, 0.0, 6.0, 2.0, 0.0]]
V矩阵
[[7.0, 0.0, 0.0, 7.0, 0.0, 1.0]
 [0.0, 9.0, 8.0, 0.0, 2.0, 0.0]]

我们假定head 为2

那么矩阵Q K V 会被拆解为

lua 复制代码
拆解后的
Q_1矩阵             Q_2矩阵
[[1.0, 0.0, 0.0]   [[9.0, 0.0, 8.0]
 [0.0, 2.0, 2.0]]   [0.0, 6.0, 0.0]]
K_1矩阵             K_2矩阵
[[3.0, 0.0, 3.0]   [[0.0, 0.0, 5.0]
 [0.0, 4.0, 0.0]]   [6.0, 2.0, 0.0]]
V_1矩阵             V_2矩阵
[[7.0, 0.0, 0.0]   [[7.0, 0.0, 1.0]
 [0.0, 9.0, 8.0]]   [0.0, 2.0, 0.0]]

我们在使用attention公式(这里我们做了简化):

得到

ini 复制代码
Head_1 =
[
  [5.948, 1.353, 1.203],
  [1.677, 6.843, 6.083]
]
Head_2 =
[
  [0.002, 1.999, 0.0003],
  [0.0069, 1.998, 0.0010]
]

然后Concat(Head_1, Head_2)得到如下:

csharp 复制代码
[
  [5.948, 1.353, 1.203, 0.002, 1.999, 0.0003],
  [1.677, 6.843, 6.083, 0.0069, 1.998, 0.0010]
]
相关推荐
阳光是sunny7 小时前
LangGraph中的Reducer是什么
前端·人工智能·后端
灯澜忆梦7 小时前
GO_并发编程---定时器
开发语言·后端·golang
阳光是sunny7 小时前
从链到图:LangGraph 入门基础全解析
前端·人工智能·后端
皮皮林5517 小时前
开源实力派,给本地 AI 装上深度调研能力,一张 3090 跑到 95.7 分!
后端
努力的小雨8 小时前
把 Windows 桌面图标做成一个会自己运转的小世界
后端
武子康9 小时前
Search Console Platform Properties 扩大 SEO 资产边界:从 Page Ranking 到 Topic Coverage(5 类误读边界 + 3 表数据层设计)
前端·人工智能·后端
腾渊信息科技公司9 小时前
Spring Boot对接MES实战:视觉检测数据自动同步方案
java·人工智能·spring boot·后端·计算机视觉·ai·软件需求
IT_陈寒10 小时前
Vue这个特性差点让我加班到凌晨,谁懂啊
前端·人工智能·后端
段一凡-华北理工大学11 小时前
向量数据库实战:选型、调优与落地~系列文章12:文本分块策略实战:chunk_size 怎么选?重叠多少?
开发语言·数据库·后端·oracle·rust·工业智能体·高炉智能化
码事漫谈11 小时前
1999年的电商前夜和2026年的AI前夜 历史押韵但从不重复
后端