Policy model

Policy Model(策略模型)极简说

强化学习里负责输出动作/决策的网络就是policy model。

• 输入当前状态,输出该做什么动作、每个动作的概率;

• 大模型RLHF里,policy model就是主大模型,用来生成回答。

一句话:拿主意、输出行为的模型。

与backbone模型的关系:

  1. Policy model(策略模型):RL里专门用来输出动作(LLM里就是生成文本)的模型,是RL流程里的决策主体。

  2. Backbone(骨干/基座):模型底层基础权重,是policy model的载体。

直白讲:

RLHF里,SFT微调后的基座backbone,包装成policy model来做文本生成;

backbone是权重本体,policy model是它在强化学习里的角色叫法,二者不是完全同一个概念,但共用一套主干网络。

相关推荐
满怀冰雪12 小时前
06-自动微分入门:用 Paddle 计算梯度
人工智能·python·深度学习·paddle
科技林总17 小时前
图像处理领域的技术发展
人工智能·深度学习·计算机视觉
weixin_4684668518 小时前
从Transformer到ViT与Swin详解
人工智能·深度学习·transformer·computer vision·vit·卷积·swin
小白说大模型19 小时前
从向量嵌入到复杂 Agent:LLM、LangChain、LangGraph 完整科普
java·开发语言·人工智能·gpt·深度学习·langchain
薛定e的猫咪20 小时前
Codex全套科研技能汇总
人工智能·深度学习
大鹏的NLP博客20 小时前
Padding 对工业声学异常检测中自编码器判分逻辑的影响分析
深度学习·声音检测
Token炼金师21 小时前
异地的棋局:容灾、流量调度、数据一致性、成本与故障切换 —— 异地多活五子
人工智能·深度学习·llm
道影子1 天前
维性力网:超越时间的拓扑宇宙观
人工智能·深度学习·神经网络·拓扑学
人间凡尔赛1 天前
世界模型入门实战:从RTFM到理解物理世界 | 2026深度技术解析
javascript·人工智能·深度学习·机器学习