什么是unigram语言模型

文章目录

Unigram 语言模型 (一元文法模型)是自然语言处理(NLP)中最简单、最基础的统计语言模型(N-gramN\text{-gram}N-gram 模型中 N=1N=1N=1 的特例)。


核心假设:词与词相互独立

Unigram 模型基于一个极强的假设------条件独立性假设(Bag-of-Words 词袋思想):

文本中每个词的出现概率完全独立,与其他任何词(上下文)无关,只取决于该词在语料库中自身的出现频率。

对于一个由 nnn 个词组成的句子 W=(w1,w2,...,wn)W = (w_1, w_2, \dots, w_n)W=(w1,w2,...,wn),根据全概率链式法则:

P(W)=P(w1)P(w2∣w1)P(w3∣w1,w2)...P(wn∣w1,...,wn−1)P(W) = P(w_1) P(w_2 \mid w_1) P(w_3 \mid w_1, w_2) \dots P(w_n \mid w_1, \dots, w_{n-1})P(W)=P(w1)P(w2∣w1)P(w3∣w1,w2)...P(wn∣w1,...,wn−1)

Unigram 假设下,条件概率被彻底简化为每个词的无条件概率之积:

P(W)=∏i=1nP(wi)=P(w1)⋅P(w2)⋅⋯⋅P(wn)P(W) = \prod_{i=1}^n P(w_i) = P(w_1) \cdot P(w_2) \cdot \dots \cdot P(w_n)P(W)=i=1∏nP(wi)=P(w1)⋅P(w2)⋅⋯⋅P(wn)


参数估计(最大似然估计 MLE)

单个词 www 的概率计算非常直观,直接统计其在训练语料库中的词频占比:

P(w)=C(w)NP(w) = \frac{C(w)}{N}P(w)=NC(w)

  • C(w)C(w)C(w):词 www 在训练集中出现的次数。
  • NNN:语料库中所有词的总数(Total Tokens)。

具体例子

假设语料库中只有三句话:

  1. I love cats
  2. I love dogs
  3. You love dogs

总词数 N=9N = 9N=9。各词概率为:

  • P(I)=29,P(love)=39,P(dogs)=29,P(cats)=19,P(You)=19P(\text{I}) = \frac{2}{9},\quad P(\text{love}) = \frac{3}{9},\quad P(\text{dogs}) = \frac{2}{9},\quad P(\text{cats}) = \frac{1}{9},\quad P(\text{You}) = \frac{1}{9}P(I)=92,P(love)=93,P(dogs)=92,P(cats)=91,P(You)=91

计算句子 I love dogs 的概率:

P(I love dogs)=P(I)×P(love)×P(dogs)=29×39×29≈0.0165P(\text{I love dogs}) = P(\text{I}) \times P(\text{love}) \times P(\text{dogs}) = \frac{2}{9} \times \frac{3}{9} \times \frac{2}{9} \approx 0.0165P(I love dogs)=P(I)×P(love)×P(dogs)=92×93×92≈0.0165

由于独立性假设,打乱语序后 dogs love I 的概率也是完全相同的 0.01650.01650.0165。


优缺点对比

  • 优点

  • 极简高效 :计算和存储开销极低,参数量仅等于词表大小 ∣V∣\vert{}V\vert{}∣V∣。

  • 不存在上下文稀疏问题:不需要统计"词对"或"短语"共现频次。

  • 缺点

  • 完全丧失语序和语法结构 :无法区分句子的合法性(例如 I eat appleapple eat I 概率相同)。

  • 无法捕捉上下文语义:同音异义词或多义词无法根据语境消歧。


现代应用场景

尽管 Unigram 极少直接用于生成连贯句子,但它在现代 NLP 中依然扮演着关键角色:

  1. 子词分词算法(Subword Tokenization) :如 SentencePiece / Unigram LM Tokenizer,通过衡量剪枝候选子词后对整体 Unigram 似然值的损失,来构建最优化的大模型词表。
  2. 基线模型(Baseline):用于文本分类、朴素贝叶斯(Naive Bayes)分类器、信息检索(TF-IDF / BM25 语言建模法)。
相关推荐
william_yangshun4 小时前
【AI Agent 实战】agent-vision-toolkit 中文版:给纯文本模型(DeepSeek)装上视觉能力
人工智能·多模态
智能体与具身智能4 小时前
TVA具身智能的概念、架构与应用(19)
人工智能·python·具身智能
AI智能体工作室4 小时前
生产级 RAG 检索增强架构实战:向量数据库、混合检索(Hybrid Search)、RRF 融合与重排(Rerank)全链路
人工智能
geinvse_seg5 小时前
我做了个 AI 架构审查员,把整个微服务项目通读了一遍,还顺手做成了 Skill
人工智能
李帅朋5 小时前
微分基本定义笔记
人工智能·笔记·深度学习·神经网络
醍醐实验室5 小时前
下一代端到端全模态(Omni)模型解密:离散音频 Token 化与极速双工流式交互架构
人工智能
米小虾5 小时前
你的 Agent 有 1000 万上下文,为什么第 50 轮就开始失忆?
人工智能·agent
东风破_5 小时前
Text2SQL :用自然语言操作 SQLite 数据库
人工智能·后端
吴佳浩 Alben5 小时前
Agent 怎么做自动化评测?构建端到端的 Agent Evaluation 体系
人工智能·语言模型·架构·自动化·ai编程
G***技5 小时前
告别“云端依赖”:LH707 如何重构 AI 视频监控的底层逻辑?
人工智能·嵌入式硬件