大模型评估指标

大模型各阶段指标对应关系(明确:偏好对齐指标仅微调后有)

核心结论

偏好对齐类指标(WinRate、人类偏好分、拒绝率等)并非原生自带,仅在经过 SFT、DPO 微调后才会出现、才需要评估;预训练原生底座无此类指标,测之无意义。

一、预训练底座(无微调,原生状态)

核心能力

仅具备基础语言、知识能力,不会跟随指令、不懂人类偏好,仅能完成基础续写。

唯一需测指标(无偏好对齐相关)

  1. 基础生成质量:Perplexity(PPL,困惑度)、Repetition Rate(重复率)
  2. 文本匹配:BLEU、ROUGE-L、BERTScore
  3. 基础能力:知识覆盖率、基础逻辑推理正确率、语言流畅度

二、SFT 有监督微调后(首次对齐人类指令)

核心能力

学会跟随指令、按问答格式输出,初步贴合人类对话习惯,摆脱原生续写模式。

新增需测指标(初步偏好相关,非核心)

  1. 指令对齐:指令跟随率、约束遵守率(格式、字数等)
  2. 基础偏好:回答流畅自然度、对话连贯性、基础回答质量(不啰嗦、不跑偏)
  3. 保留基础指标:延续预训练阶段所有基础指标(验证能力无丢失)

三、DPO 偏好对齐微调后(重点优化人类偏好)

核心能力

明确区分回答好坏、贴合人类偏好,具备安全边界、减少幻觉,优化话术分寸。

新增专属偏好对齐指标(核心重点)

  1. 偏好对比:WinRate(对局胜率,DPO vs SFT)、人类偏好分
  2. 安全对齐:拒绝率(违规请求)、幻觉率、Toxicity(有害内容毒性值)
  3. 话术优化:简洁度、冗余度、回答一致性(同问题不矛盾)
  4. 保留指标:延续 SFT 阶段所有指标(验证指令能力无丢失)

四、各阶段指标对比表

模型阶段 核心能力 重点评估指标 有无偏好对齐指标
预训练底座 基础语言、知识续写 PPL、BLEU、ROUGE、知识覆盖率、基础推理 无
SFT 微调 指令跟随、基础对话 指令跟随率、流畅度、连贯性、基础指标 有(初步,非核心)
DPO 微调 偏好对齐、安全合规 WinRate、人类偏好分、拒绝率、幻觉率、简洁度 有(核心,专属)

补充说明

  1. 偏好对齐指标的核心是「贴合人类需求」,原生底座无此训练目标,因此无对应能力、无需评估;
  2. SFT 是偏好对齐的基础(让模型"听话"),DPO 是偏好对齐的核心(让模型"好听、安全");
  3. 评估逻辑:从底座→SFT→DPO,逐步新增偏好、安全类指标,同时验证基础能力不丢失。
相关推荐
跟我学机器学习8 小时前
Qwen3 Reranking原理与使用:重排模型在 RAG 中的作用
人工智能·深度学习·transformer
高洁0115 小时前
数字孪生驱动大模型工业知识库
人工智能·python·深度学习·机器学习·transformer
高洁011 天前
具身智能中的世界模型训练
人工智能·python·深度学习·机器学习·transformer
for_ever_love__2 天前
线性代数入门——向量、矩阵与点积,Transformer 的运算本质
线性代数·矩阵·transformer
OxYGC3 天前
玩转大模型 第一篇:认识大模型——它到底是什么、能干什么、开源和闭源差在哪
大模型·transformer·开源大模型·ai基础
ForDreamMusk3 天前
Transformer Encoder Block
人工智能·深度学习·transformer
Alice-YUE3 天前
前端 × AI:从 Cursor 到 Transformer,一份完整认知路径
前端·人工智能·transformer·ai编程·前端开发·cursor
zxsz_com_cn3 天前
预测性维护中的时间序列异常检测:从3sigma到Transformer
transformer·工业4.0·异常检测·时间序列·预测性维护
程序猿阿森4 天前
Transformer 相对 CNN/RNN 的核心优势:全局依赖、并行计算与可扩展性
rnn·cnn·transformer
倔强的石头1065 天前
【Transformer】上下文长度扩展技术综述
人工智能·深度学习·transformer