从NLP到大语言模型

从NLP到大语言模型

NLP 技术演进的四条路径

1. 基于规则的符号主义

  • 核心思想:语言是规则系统,由语言学家手工编写词典和语法规则。
  • 局限:无法应对真实语言的歧义、灵活性和开放性------规则永远写不完。

2. 基于统计的机器学习

  • 核心思想:从大规模标注数据中自动学习统计规律,不再死记规则。
  • 核心方法:特征工程 + 统计模型,如 HMM(隐马尔可夫模型,用于序列标注)、CRF(条件随机场,解决标签间依赖关系)、N-gram(用前 N-1 个词预测当前词的概率)。
  • 局限:特征仍需人工设计,且模型捕捉不到长距离语义关系。

3. 基于深度学习的神经网络

  • 核心思想:让模型自动从数据中学习层次化的特征表示,彻底省去人工设计特征。
  • 技术演进
    • Word2Vec:将词映射为稠密向量,让语义相近的词在向量空间中也接近。
    • RNN/LSTM:循环神经网络,按顺序逐个处理词,LSTM 通过门控机制缓解了长序列的遗忘问题。
    • Seq2Seq+Attention:编码器-解码器结构,注意力机制让解码器在生成每个词时能回看输入序列中相关的部分。
    • Transformer:完全抛弃循环结构,全凭注意力并行处理整个序列。
  • 关键:Transformer 是这条线上最具突破性的架构。

4. 预训练大模型

  • 核心思想:"预训练 + 微调/提示"------先在海量无标注文本上训练通晓语言的通用模型,再在小量标注数据上适配具体任务。
  • 关键 :BERT 和 GPT 都是这条路的产物。它改变的是使用模型的方法论,而非单一技术构件------本质上仍属于深度学习,但范式革命性让它值得单独视为一个阶段。

Transformer 的自注意力突破

Transformer 是一种完全基于自注意力机制的神经网络架构,解决了长距离建模和并行计算的核心难题。

  • 原始结构 :由编码器 (理解输入)和解码器(生成输出)两部分组成,最初用于机器翻译。
  • 核心机制:自注意力
    • 让模型在处理一个词时,能同时关注句子中所有其他词,并计算它们之间的关联度。
    • 成功捕捉长距离依赖,如代词"它"指代句首的"狗"。
    • 实现方式 :每个词通过三个权重矩阵分别生成三个向量------Q(Query)K(Key)V(Value) 。用当前词的 Q,逐一与句中每个词(包括自己)的 K 做点积 ,得到一列原始分数------Q 与第 i 个词的 K 点积所得的分数,反映的就是当前词与第 i 个词之间的相关性,分数越高关系越紧密。将这些分数归一化为权重后,对所有词的 V 做加权求和------关系紧密的词,其内容被大量纳入;关系远的词,其内容几乎被忽略。最终每个词得到一个融合了上下文信息的新表示。
    • 实际使用多头注意力:并行做多组独立的 Q/K/V 投影(多个"头"),每组关注不同的语义侧面,最后拼接起来综合判断。

一条岔路:BERT 与 GPT 的分道扬镳

两者都是基于 Transformer 的预训练大模型,但设计理念和应用方向截然不同。

对比维度 BERT GPT
架构基础 Transformer 编码器 Transformer 解码器
注意力机制 双向自注意力(能看到上下文全局) 掩码自注意力(只能看到上文,单向)
训练任务 完形填空(掩码语言模型 MLM) 预测下一个词(自回归语言模型)
核心能力 自然语言理解(NLU) 自然语言生成(NLG)
典型应用 文本分类、实体识别、情感分析 文本续写、对话、创意写作、代码生成
  • BERT 路线:强于"读懂文章",是强大的文本分析工具,但不能流畅生成。
  • GPT 路线:强于"写",将一切任务统一为文本生成。

Decoder-Only 何以成为主流

当前主流的大语言模型,都是沿着 GPT 路线发展的纯解码器架构

  • 架构要点 :只使用原始 Transformer 的解码器部分,并移除了用于接收编码器输出的交叉注意力层
  • 为什么是它?
    • 任务统一:所有任务(翻译、问答、编程)都可视为"预测下一个词"的文本生成问题。
    • 潜力巨大:在"预测下一个词"这一简单目标下不断扩大模型规模,推理和泛化能力会自然涌现。
    • 理解融合:模型在预测下一个词的过程中,自然地完成了对输入文本的"编码"和"理解"。
  • 主流模型代表:GPT 系列、ChatGPT、LLaMA、Gemini、Claude、文心一言、通义千问等。

总结

  • 广义上说 :现代大模型都是 Transformer 架构,核心是自注意力机制。
  • 精确地说 :它们是 Transformer 架构中的 Decoder-Only(仅解码器)变体,模型通过"预测下一个词"这一任务,将理解和生成能力统一。