Policy model

Policy Model(策略模型)极简说

强化学习里负责输出动作/决策的网络就是policy model。

• 输入当前状态,输出该做什么动作、每个动作的概率;

• 大模型RLHF里,policy model就是主大模型,用来生成回答。

一句话:拿主意、输出行为的模型。

与backbone模型的关系:

  1. Policy model(策略模型):RL里专门用来输出动作(LLM里就是生成文本)的模型,是RL流程里的决策主体。

  2. Backbone(骨干/基座):模型底层基础权重,是policy model的载体。

直白讲:

RLHF里,SFT微调后的基座backbone,包装成policy model来做文本生成;

backbone是权重本体,policy model是它在强化学习里的角色叫法,二者不是完全同一个概念,但共用一套主干网络。

相关推荐
饼干哥哥4 天前
开源Skills|搭建亚马逊动态关键词库系统,每天抓SSS级机会词
人工智能·深度学习·数据分析
武子康5 天前
调查研究-191 SenseVoice 不只是 ASR:把语音从“转文字“升级成“理解状态“
人工智能·深度学习·openai
武子康7 天前
调查研究-189 Kronos 调研:金融 K 线基础模型,是真突破,还是量化圈的新玩具?
人工智能·深度学习·openai
xiao5kou4chang6kai412 天前
MATLAB机器学习、深度学习--从数据预处理到模型训练
深度学习·机器学习·matlab·数据预处理
renhongxia112 天前
世界模型作为AGI落地底层底座的作用
人工智能·深度学习·生成对抗网络·自然语言处理·知识图谱·agi
计算机科研狗@OUC12 天前
(cvpr26) AIMDepth: Asymmetric Image-Event Mamba for Monocular Depth Estimation
人工智能·深度学习·计算机视觉
β添砖java12 天前
深度学习(22)网络中的网络NiN
人工智能·深度学习
Kobebryant-Manba12 天前
深度学习时候d2l报错和使用问题
人工智能·深度学习
zhangfeng113312 天前
deepspeed zero3 结合 llamafactory 微调 ,save_only_model: true 导致保存时候出错
开发语言·python·深度学习
大模型最新论文速读12 天前
06-16 · LLM 最新论文速览
论文阅读·人工智能·深度学习·机器学习·自然语言处理