大模型评估指标

大模型各阶段指标对应关系(明确:偏好对齐指标仅微调后有)

核心结论

偏好对齐类指标(WinRate、人类偏好分、拒绝率等)并非原生自带,仅在经过 SFT、DPO 微调后才会出现、才需要评估;预训练原生底座无此类指标,测之无意义。

一、预训练底座(无微调,原生状态)

核心能力

仅具备基础语言、知识能力,不会跟随指令、不懂人类偏好,仅能完成基础续写。

唯一需测指标(无偏好对齐相关)

  1. 基础生成质量:Perplexity(PPL,困惑度)、Repetition Rate(重复率)
  2. 文本匹配:BLEU、ROUGE-L、BERTScore
  3. 基础能力:知识覆盖率、基础逻辑推理正确率、语言流畅度

二、SFT 有监督微调后(首次对齐人类指令)

核心能力

学会跟随指令、按问答格式输出,初步贴合人类对话习惯,摆脱原生续写模式。

新增需测指标(初步偏好相关,非核心)

  1. 指令对齐:指令跟随率、约束遵守率(格式、字数等)
  2. 基础偏好:回答流畅自然度、对话连贯性、基础回答质量(不啰嗦、不跑偏)
  3. 保留基础指标:延续预训练阶段所有基础指标(验证能力无丢失)

三、DPO 偏好对齐微调后(重点优化人类偏好)

核心能力

明确区分回答好坏、贴合人类偏好,具备安全边界、减少幻觉,优化话术分寸。

新增专属偏好对齐指标(核心重点)

  1. 偏好对比:WinRate(对局胜率,DPO vs SFT)、人类偏好分
  2. 安全对齐:拒绝率(违规请求)、幻觉率、Toxicity(有害内容毒性值)
  3. 话术优化:简洁度、冗余度、回答一致性(同问题不矛盾)
  4. 保留指标:延续 SFT 阶段所有指标(验证指令能力无丢失)

四、各阶段指标对比表

模型阶段 核心能力 重点评估指标 有无偏好对齐指标
预训练底座 基础语言、知识续写 PPL、BLEU、ROUGE、知识覆盖率、基础推理
SFT 微调 指令跟随、基础对话 指令跟随率、流畅度、连贯性、基础指标 有(初步,非核心)
DPO 微调 偏好对齐、安全合规 WinRate、人类偏好分、拒绝率、幻觉率、简洁度 有(核心,专属)

补充说明

  1. 偏好对齐指标的核心是「贴合人类需求」,原生底座无此训练目标,因此无对应能力、无需评估;
  2. SFT 是偏好对齐的基础(让模型"听话"),DPO 是偏好对齐的核心(让模型"好听、安全");
  3. 评估逻辑:从底座→SFT→DPO,逐步新增偏好、安全类指标,同时验证基础能力不丢失。
相关推荐
JAI科研13 小时前
YOLO 完全指南(七):YOLO识别工程化 (上)
人工智能·深度学习·神经网络·yolo·目标检测·计算机视觉·transformer
程序猿编码14 小时前
扔掉 Python!纯 C++ 本地跑扩散 TTS,GGML 加持,支持 RK3588 NPU 加速
c++·计算机视觉·大模型·transformer·rk3588·推理·ggml
Zentceh1 天前
AI-ISP vs 传统ISP全面对比
人工智能·深度学习·计算机视觉·车载系统·transformer·无人机·智能硬件
tyler_download2 天前
揉扁搓圆transformer架构:NAG优化器算法详解
深度学习·算法·transformer
tiger8652 天前
深入理解状态空间模型 (SSM):RNN 与 Transformer 的优雅融合
人工智能·gpt·rnn·神经网络·自然语言处理·transformer·语音识别
大江东去浪淘尽千古风流人物3 天前
【Patch Policy】稠密视觉表示驱动的轻量级机器人策略深度解析
机器人·transformer·具身智能·机器人学习·视觉表示·patch policy
孙启超3 天前
【AI开发之Rust】第 3 课:字符串与复合类型 —— 数据怎么放
开发语言·人工智能·后端·rust·llm·transformer
June bug4 天前
【HCIA- AI(正课)】2.6.Transformer架构和Diffusion结构介绍
人工智能·深度学习·transformer
richard_first4 天前
Transformer与大语言模型:第18章 向量数据库
数据库·人工智能·自然语言处理·transformer·embedding