技术栈

instruction following

thesky123456
2 小时前
大模型·结构化输出·指令遵循·instruction following·ifeval·对齐税·alignment tax
27届大模型面试准备(四十八):指令遵循与对齐税——从 IFEval 到能力保持前面 A16 讲过后训练(SFT/RLHF/DPO),A20 讲过评测体系,A28 讲过安全对齐。有一条贯穿三者的暗线常常被忽视:模型"听话"的程度。用户给一段带约束的指令("用三点回答、每点不超过 50 字、不要出现例子、严格 JSON 输出"),模型到底能不能精确照做?这叫指令遵循(Instruction Following)。而当我们用对齐把模型变得更安全、更友好时,常常发现它在推理、代码等硬任务上变弱了——这中间的代价叫对齐税(Alignment Tax)。
我是有底线的