主流大语言模型的损失函数异同

一、核心损失函数类型

1. 自回归语言模型损失(CLM Loss)

代表模型:GPT 系列、LLaMA、Mistral、Qwen 等

复制代码
L = -∑ log P(xₜ | x₁, x₂, ..., xₜ₋₁)
  • 本质:标准交叉熵损失,预测下一个 token
  • 特点:单向注意力,适合生成任务

2. 掩码语言模型损失(MLM Loss)

代表模型:BERT、RoBERTa

复制代码
L = -∑ log P(xᵢ | x_context)  (i ∈ masked positions)
  • 本质:随机掩盖 15% token,预测被掩盖部分
  • 特点:双向注意力,适合理解任务

3. Seq2Seq 损失

代表模型:T5、BART、GLM

  • 结合编码器-解码器结构
  • T5 使用 span corruption(掩盖连续片段)

二、对齐阶段的损失函数

方法 损失函数 特点
SFT 交叉熵 监督微调,模仿人类回答
RLHF (PPO) 策略梯度 + KL 惩罚 需要奖励模型,训练复杂
DPO 隐式奖励的偏好损失 无需单独训练 RM,更稳定
ORPO 对比偏好损失 将 SFT 和偏好对齐合一

DPO 损失公式

复制代码
L_DPO = -log σ(β · (log π(y_w|x)/π_ref(y_w|x) - log π(y_l|x)/π_ref(y_l|x)))

三、主要异同总结

相同点

1.底层都基于交叉熵:无论是 CLM 还是 MLM,本质都是最大化正确 token 的概率

2.都使用 Teacher Forcing:训练时使用真实标签作为输入

3.都有 token 级别的粒度:损失在 token 层面计算后聚合

不同点

维度 GPT 类 BERT 类 T5 类
预测方向 单向(左→右) 双向 编码双向+解码单向
预测目标 下一个 token 被掩盖 token 被损坏片段
注意力 Causal Mask 全注意力 混合
适用场景 生成 理解 通用

四、前沿改进

1.长度归一化:避免模型偏好短回复

2.标签平滑(Label Smoothing):防止过拟合

3.Focal Loss 变体:处理困难样本

4.混合精度下的损失缩放:数值稳定性

相关推荐
To_OC1 小时前
大模型蒸馏是啥?说白了就是大厨带徒弟的学问
人工智能·llm·agent
新手来了@click2 小时前
JAVA+AI 简化开发操作|文章被 AI Agent 技术社区收录分享
人工智能
陳陈陳2 小时前
从“胡说八道”到“妙笔生花”:我用LangChain手搓了一个可控AI写作流(Temperature+TopK调参指南)
langchain·llm
GuWenyue2 小时前
Cursor黑盒拆解!1套LangChain.js手写Mini编程Agent,自动生成React项目,效率提升60%
前端·数据库·人工智能
GuWenyue2 小时前
传统Agent工具两大痛点!300行代码落地MCP跨语言工具,彻底解耦LLM与工具
前端·人工智能·算法
老云讲算力市场3 小时前
WAIC首日观察:国产算力与机器人加速落地,奇点算力迎来产业新机遇
人工智能·科技
糖果店的幽灵3 小时前
【DeepAgents 从入门到精通】Context Management 上下文管理
java·人工智能·后端·spring·中间件·langgraph·deepagents
小林ixn3 小时前
大模型随机说话的秘密:Temperature 和 Top K 深度解析,LangChain 实战调优
人工智能·langchain
ALINX技术博客3 小时前
ALINX 亮相 2026 WAIC 世界人工智能大会,展示 AI 视觉 FPGA+GPU 异构计算与电子后视镜解决方案
人工智能·ai·fpga·世界人工智能大会·电子后视镜
程序员老猫3 小时前
当 AI 能写 80% 的代码时,后端工程师的核心价值还剩什么?
人工智能