MiniMind 学习笔记(十三):SFT 导言——从“续写文本“到“回答用户“SFT 是 Supervised Fine-Tuning(监督微调),通常接在 Pretrain 之后:用整理好的指令、问答或多轮对话数据,让一个主要学会"续写文本"的基座模型,进一步学会按照用户输入给出回答。有了 Pretrain 的基础,SFT 的训练形式会简单很多——它并没有发明一个全新的 loss,仍然是 next token prediction。真正变化的是训练数据的组织方式,以及哪些 token 会参与 loss。