八股-大语言模型基础

一、LLM的概念

  1. LLM 大型语言模型:Large Language Models
  2. 主流的开源模型体系都是基于 Transformer 架构:
    • Encoder 在抽取序列中某一个词的特征时能够看到整个序列中所有的信息,即上文和下文同时看到 ;而 Decoder 中因为有 mask 机制的存在,使得它在编码某一个词的特征时只能看到自身和它之前的文本信息。
  3. Prefix/Causal LM:
    • Prefix LM 前缀语言模型:
      • Encoder和Decoder共享了同一个Transformer结构
      • Encoder:AE-自编码 前缀序列中任意两个token都相互可见Auto Encoding
      • Decoder:AR-自回归 待生成的token可以看到Encoder侧所有token(包括上下文)和Decoder侧已经生成的token,但不能看未来尚未产生的token
    • Causal LM 因果语言模型:
      • Decoder:Auto Regressive 自回归
      • GPT
  4. 训练目标:最大化模型生成训练数据中观察到的文本序列的概率
    • 最大似然估计 MLE
  5. 涌现能力:模型在训练过程中能够生成出令人惊喜、创造性和新颖的内容或行为
  6. Decoder only结构
    • Encoder的双向注意力 存在低秩问题,削弱模型表达能力
    • 更好的Zero-Shot性能、更适合于大语料自监督学习
    • 效率:decoder-only支持一直复用KV-Cache,多轮对话更友好,每个Token的表示和之前输入有关
  7. LLMs复读机问题:依赖输入文本的复制
    • 解决: 多样性训练数据、引入噪声、温度参数调整、Beam搜索调整、后处理和过滤、人工干预
  8. Bert通用、LLaMA英文、ChatGLM中英文适用场景
  9. 让大模型处理更长的文本解决方法:
    • 分块、层次建模文本分为段落、句子或子句、部分生成模型生成文本的一部分、引入注意力机制、模型结构优化结构、参数
相关推荐
智圣新创013 分钟前
教育新基建下高校数据治理决策转型:智圣新创决策中台全域建设效能提升路径
大数据·人工智能
Tokenge5 分钟前
什么是CodeBuddy ,和WorkBuddy 有什么区别!
人工智能
桃西西呀6 分钟前
Spring AI Alibaba 之七:我没写一行 tracing 埋点,Agent 每一步却被 Micrometer 看得清清楚楚
人工智能·spring·llm
桃西西呀6 分钟前
Spring AI Alibaba 之八:我让 Agent 直接执行 shell 命令,它却读到了目录里的密钥,沙箱到底防住了什么
人工智能·spring·llm
Hi202402176 分钟前
Vortex GPGPU Warp 调度与指令执行流程解读
人工智能·gpgpu
9i编程8 分钟前
9. 教 AI 上班:带出我的数字同事 —— 部署到本机再大回归:组织架构又错,被我叫停先改树
人工智能·openai·ai编程
遇码10 分钟前
system prompt 里拼了时间和知识大纲,每轮缓存都被击穿:静态/动态分离的提示词装配方法
人工智能·ai·大模型
a932014 分钟前
基准真值也会错:我的 AI 审计管线漏报 12 题,先别急着调模型
人工智能
俊哥V15 分钟前
每日 AI 研究简报 · 2026-10-10
人工智能·ai
程序人生88816 分钟前
PDF 转 Word 版式错乱、表格丢失?DocConverter Web 格式互转引擎的保真实践
前端·人工智能·opencv·机器学习·pdf·word