27届大模型面试准备(十六):后训练全攻略——SFT、RLHF、DPO、PPO 一次讲透上一篇《高效推理全攻略》讲的是"怎么让模型推理又快又省",属于部署侧。这一篇回到训练侧,把"预训练之后的所有事"——也就是后训练(Post-Training)——一次性讲透。覆盖 SFT、Reward Model、RLHF(PPO)、DPO 四条主线,外加一条工程副线(数据配方、课程学习、拒绝采样)。每节都给:原理 → 数学/算法骨架 → 代码片段 → 面试速答 + 高频追问。配合《LoRA/PEFT》(候选 A18)一起看,刚好串成"对齐怎么做、怎么省显存做"。