1.ai infra 的全称是 ai infrastructure 相关的技术,具体涉及的岗位有 GPU 算子优化、推理优化、分布式训练。
这三者都是围绕着以 transfomer 的 decoder 模式涌现的大模型在不同阶段产生的岗位,比如推理优化是指在大模型训练完成之后,如何更高效的使用模型,降低延迟,提高吞吐量,在这个基础上的技术有 PagedAttention、prefix sharing 等等。
2.浅谈 Transformer 技术
Transformer 最传统的形式是编码器解码器两部分组成,用比喻的话,比如一个人打算把一段英文莎士比亚翻译成中文,编码器的作用就是去理解英文的意思,解码器就是去根据这个理解再去输出中文结果。
transfomer 的机制是一种叫做自注意力机制,它使得模型不同 token 之间的理解和关联跨越距离,解决了传统的 cnn 感受野有限,rnn 串行计算以及信息随着距离变远丢失的问题。
现在大模型主要采取单 decoder(解码器)结构,采用这种结构比最原始结构的好处就是模型的结构更加简单。
3.一个模型从输入的 prompt(比如你问豆包,在上海哪里好玩),到模型输出结果的过程主要包括
分词,模型是机器的,首先得把我们的句子分成多个词,tokenize,不过这里的分词不一定是严格意义上的一个单词,比如 luckily 可能就是 luck 和 ily,ily 是常见的形容词的后缀,或者 happiness 分成 happ 和 iness。
分词之后要变成词元,即机器里的"字典"。
在这之后是输入到模型里层层计算,产生输出。
最后把输出从词元概率反变换回词元,即输出的结果。
总结:要理解 ai infra 各种技术,传统的后端知识很重要,不管是 cpp 还是 java 或者 go、Python,通过这些领域积累的知识复利性很强。
当前的岗位主要围绕的是 Transformer 语言模型架构各个阶段的优化产生的,具体的有在训练前,有在训练之后的使用。