【LLM基础研究】核心七:PPO

PPO(Proximal Policy Optimization)是大语言模型(LLM)对齐中主流的强化学习算法,通过裁剪机制稳定策略更新,结合奖励模型(RM)与参考模型(Reference Model)实现人类偏好对齐,典型用于 RLHF 流程(SFT 后微调);但因需同时维护策略、价值(Critic)、奖励和参考四类模型,显存开销大,近年在千亿级模型中正被 GRPO、DPO 等轻量替代。‌‌

HRL 优先用

长序列任务:机器人导航、机械臂多步骤组装、游戏闯关(分段完成目标)、奖励稀疏:只有最终成功才有奖励,中间无反馈。解决痛点:长时序稀疏奖励、大动作空间、多阶段复杂任务(导航、机器人操控)。

DRL 优先用

环境交互耗时、需要海量样本:自动驾驶仿真、大规模游戏 AI、大参数量强化学习模型训练。解决痛点:单环境采样慢、训练样本不足、大模型训练耗时过长。

分层强化学习 Hierarchical RL(HRL)从决策逻辑分层,把一个难任务拆成「高层宏观决策 + 低层动作执行」,属于算法层面改进,单卡也能跑。

分布式强化学习 Distributed RL(DRL)从计算资源拆分,多进程 / 多机器并行采集样本、梯度更新,属于工程训练架构,算法本身可以是 DQN/PPO/A3C 任意普通 RL。

相关推荐
liukuang1101 分钟前
董宇辉带走流量,东方甄选留下印钞机
大数据·网络·人工智能
≮傷£≯√3 分钟前
OpenCV ncnn 人脸识别(一)
服务器·人工智能·opencv
deng12043 分钟前
Maven多模块父子工程与IDEA导入异常排查记录
人工智能·maven·intellij-idea
动物园猫3 分钟前
绝缘子目标检测数据集:2,000张图像 | 目标检测
人工智能·目标检测·计算机视觉
甲维斯4 分钟前
很遗憾!GPT5.6SOL又输给了O哥了!
人工智能
彩讯股份30063411 分钟前
Claude Code 开启多 Session 通信,Rich AIBox 拆解多智能体 AI 团队
人工智能
我不是疯子是傻子13 分钟前
用 DeepSeek 将 Modbus 协议文档自动化为 Qt 枚举与寄存器结构体?「文档解析+AI生成+编译验证」的代码工厂实践
人工智能·qt·自动化
小淮AI14 分钟前
告别水印困扰?2026年AI图像修复工具实测
人工智能
泛凡(Linyongui)17 分钟前
第三篇、生命的bug分两种:一种是Flash坏了,一种是RAM乱了
人工智能·单片机·程序人生
OAK中国_官方19 分钟前
在 OAK 上进行箱体尺寸测量:无需专用测量系统
人工智能·机器人·oak深度相机·箱体测量