trl

【LLM微调】拒绝“假装聪明”：SFTTrainer 中 completion_only_loss 新旧版本用法详解在指令微调（SFT）大模型时，你是否遇到过：训练 Loss 迅速降到 0.0x，准确率飙升到 99%，但模型实际推理效果却很差？

为视觉语言多模态模型进行偏好优化训练模型使得它能够理解并预测人类偏好是一项比较复杂的任务。诸如 SFT (Supervised finetuning) 的传统的方法一般都需要耗费较大成本，因为这些算法需要对数据打上特定的标签。而偏好优化 (Preference Optimization) 作为一种替代选项，通常可以简化这一过程，并产出更准确的结果。通过对候选回答的对比和排序，而不是赋予固定的标签，偏好优化使得模型能更高效地捕捉人类偏好中的细微差别。

使用 DDPO 在 TRL 中微调 Stable Diffusion 模型扩散模型 (如 DALL-E 2、Stable Diffusion) 是一类文生图模型，在生成图像 (尤其是有照片级真实感的图像) 方面取得了广泛成功。然而，这些模型生成的图像可能并不总是符合人类偏好或人类意图。因此出现了对齐问题，即如何确保模型的输出与人类偏好 (如“质感”) 一致，或者与那种难以通过提示来表达的意图一致？这里就有强化学习的用武之地了。

我是有底线的