从生成式模型开始的技术延伸(1)大语言模型:符号空间中的统计自洽 在计算语言学中,语言模型被严格定义为“对词序列概率分布进行建模的计算模型”(Jurafsky & Martin, 2023),即给定一个符号序列的前缀,预测下一个符号的条件概率。 以GPT-4、Claude、Llama 等为代表的大语言模型,利用Transformer 架构,将这一传统定义推向了极致。Transformer 的核心是自注意力机制,允许序列中的每一个位置直接关注上下文的所有其他位置,从而捕获长距离的语义依赖。在训练过程中,文本经过分词器被切分为Toke