八股-大语言模型基础

一、LLM的概念

  1. LLM 大型语言模型:Large Language Models
  2. 主流的开源模型体系都是基于 Transformer 架构:
    • Encoder 在抽取序列中某一个词的特征时能够看到整个序列中所有的信息,即上文和下文同时看到 ;而 Decoder 中因为有 mask 机制的存在,使得它在编码某一个词的特征时只能看到自身和它之前的文本信息
  3. Prefix/Causal LM:
    • Prefix LM 前缀语言模型:
      • Encoder和Decoder共享了同一个Transformer结构
      • Encoder:AE-自编码 前缀序列中任意两个token都相互可见Auto Encoding
      • Decoder:AR-自回归 待生成的token可以看到Encoder侧所有token(包括上下文)和Decoder侧已经生成的token,但不能看未来尚未产生的token
    • Causal LM 因果语言模型:
      • Decoder:Auto Regressive 自回归
      • GPT
  4. 训练目标:最大化模型生成训练数据中观察到的文本序列的概率
    • 最大似然估计 MLE
  5. 涌现能力:模型在训练过程中能够生成出令人惊喜、创造性和新颖的内容或行为
  6. Decoder only结构
    • Encoder的双向注意力 存在低秩问题,削弱模型表达能力
    • 更好的Zero-Shot性能、更适合于大语料自监督学习
    • 效率:decoder-only支持一直复用KV-Cache,多轮对话更友好,每个Token的表示和之前输入有关
  7. LLMs复读机问题:依赖输入文本的复制
    • 解决: 多样性训练数据、引入噪声、温度参数调整、Beam搜索调整、后处理和过滤、人工干预
  8. Bert通用、LLaMA英文、ChatGLM中英文适用场景
  9. 让大模型处理更长的文本解决方法:
    • 分块、层次建模文本分为段落、句子或子句、部分生成模型生成文本的一部分、引入注意力机制、模型结构优化结构、参数
相关推荐
深小乐16 分钟前
用AI做了6首歌曲MV后,我最大的收获不是会做了,而是干中学
人工智能
郑午时光20 分钟前
全球首发!2026年适合IP短剧长视频的AI视频生成工具,即梦seedance2.5轻松做短剧
人工智能·tcp/ip·音视频
智道天成25 分钟前
浙江代办食品生产许可证怎么办理,哪些企业可以申请全程代办服务
人工智能
汇策研习社37 分钟前
双指标共振交易体系:GMMA趋势骨架 + MACD动能验证实战全解
大数据·人工智能·信息可视化·金融·区块链·fastbull
皮皮虾❀43 分钟前
阿里巴巴“千问办公”公测深度解析:企业级Agent如何重塑智能办公
人工智能·阿里云·云计算
G31135422731 小时前
大模型不可用时,业务还能不能继续:企业需要设计降级方案
大数据·服务器·数据库·人工智能·深度学习
TechEdu2026061 小时前
[人工智能]TensorFlow深度学习框架工程实践概览
人工智能·深度学习·ai·tensorflow
qq_454245031 小时前
大模型循环调用:从协议级到应用级的循环控制谱系
人工智能
万物皆智能1 小时前
AI合规面试:AI合规常见面试题与答题思路
人工智能·面试·职场和发展
AI直播技术杂谈1 小时前
AI直播推流链路中延迟优化的通用技术方案
开发语言·人工智能·php