LLM Post-Training

1. LLM的后训练分类

  • Fine-tuning
  • Reinforcement Learning
  • Test-time Scaling

|------------------------|------------------------------------------------------------------------------------------------------|------------------------------------------------------------------------------------------------------|
| 方法 | 优点 | 缺点 |
| Fine-tuning | 任务适应性:能够针对特定任务或领域进行优化,提升模型在该任务上的性能。 数据驱动优化:利用标注数据直接调整模型参数,使模型更好地符合任务要求。 广泛适用性:适用于多种任务,包括文本生成、问答、分类等。 | 过拟合风险:可能导致模型在训练数据上表现良好,但在未见过的数据上性能下降。 计算成本高:需要对整个模型或大量参数进行更新,计算资源消耗大。 数据偏差敏感:如果训练数据有偏差,模型可能学习到错误的模式。 |
| Reinforcement Learning | 动态优化:能够根据环境反馈动态调整策略,优化长期目标。 适应性强:可以处理复杂的、动态变化的任务,如对话生成、多步推理等。 对齐用户意图:通过奖励信号优化模型输出,使其更符合人类偏好。 | 奖励函数设计复杂:需要精心设计奖励函数,以避免奖励误导或奖励黑客问题。 训练不稳定:由于奖励信号稀疏且主观,可能导致训练过程不稳定。 计算资源需求高:尤其是当模型规模较大时,训练成本显著增加。 |
| Test-time Scaling | 推理时优化:在推理阶段动态调整模型行为,无需重新训练模型。 资源灵活分配:可以根据任务复杂度灵活调整计算资源,提高推理效率。 性能提升:在某些任务上,通过优化推理过程可以显著提升模型性能。 | 推理延迟增加:在某些情况下,如使用复杂的搜索策略,可能导致推理时间延长。 适用性有限:某些方法可能仅适用于特定类型的任务或模型。 环境依赖:某些技术(如蒙特卡洛树搜索)可能对环境设置较为敏感。 |

2. 微调

3. 强化学习

4. Test Time Scaling(测试时扩展)

5. 参考

https://arxiv.org/pdf/2502.21321

https://github.com/mbzuai-oryx/Awesome-LLM-Post-training

相关推荐
Allen_LVyingbo4 分钟前
医疗人工智能项目全生命周期管理系统:监管知识建模、工程实现与实证评估(下)
大数据·数据库·人工智能·python·自然语言处理·自动化
Forerror20267 分钟前
MAI Gateway(魔芋企业级AI网关)从零讲起:大模型网关解决什么问题?小白也能看懂
人工智能·maigateway·finapi·企业级ai网关·大模型财务管控·企业级大模型治理网关
志栋智能7 分钟前
超自动化巡检如何生成“有灵魂”的运维报告?
大数据·运维·人工智能·架构·自动化
千里码aicood7 分钟前
pyqt基于pytorch的人脸交换系统设计(opencv)
人工智能·pyqt
凌风的跨境分享8 分钟前
Temu运营避坑指南:制造地点信息填写合规要点与批量优化方法
运维·服务器·人工智能
来让爷抱一个11 分钟前
2026 表示工程实战:八帧跳跃不许特征乱漂,百智云精灵图把激活引导写进素材包
人工智能·机器学习
熊猫钓鱼>_>12 分钟前
从拍照到建模:HarmonyOS 7 3DGS端侧重建完整实战指南
人工智能·3d·ai·harmonyos·arkts·鸿蒙·3dgs
TechEdu20260613 分钟前
[人工智能]人工智能硬件与芯片的历史与演进:全球视角下的架构、制造、存储、软件生态与系统经济性
人工智能·ai
单向箔15 分钟前
03|AGENTS.md:给 AI 的项目说明书
人工智能·ai编程
Token掘金室15 分钟前
OpenAI Realtime API语音对话开发入门
人工智能·ai