Softmax Strategy

1. epsilon-greedy strategy

11111

2. UCB strategy

222

3. Softmax strategy

333

4. Gradient strategy

444

References

1 科学网---【RL系列】Multi-Armed Bandit笔记------Softmax选择策略 - 管金昱的博文

2 The Epsilon-Greedy Algorithm | James D. McCaffrey

相关推荐
计科杨某人14 小时前
机器学习基本常识
随机森林·机器学习·支持向量机·监督学习·强化学习·最小二乘法·无监督学习
云和数据.ChenGuang2 天前
fastapi项目拆分实战数据模型
java·服务器·数据库·人工智能·深度学习·fastapi·强化学习
林泽毅10 天前
PyTRIO快速入门实战篇(二):用 GRPO 提升 GSM8K 数学推理准确率
人工智能·深度学习·机器学习·llm·强化学习
幻影123!13 天前
从零训练一个会下五子棋的AI
python·深度学习·神经网络·强化学习·五子棋·alpha zero·mokugo
我是小邵18 天前
Zero RL:当 AI 学会“顿悟“——零强化学习的狂欢与阵痛
强化学习·大模型训练·grpo·zero rl
盼小辉丶19 天前
PyTorch强化学习实战(20)——优势演员-评论家(Advantage Actor-Critic, A2C)
pytorch·深度学习·强化学习·优势演员-评论家算法
GRITJW19 天前
从固定数据到在线策略:SFT、RL 与 OPD 如何重塑模型分布
强化学习·大模型微调
阿木实验室22 天前
预设航线之外,无人机如何应对变化?
强化学习·自主无人机
一颗小树x1 个月前
《VLA 系列》AMP 代码复现 | 强化训练 | 行走 跌倒 恢复
机器人·强化学习·amp·vla·复现
飞思实验室1 个月前
跨越算力鸿沟与不可微壁垒:GPU张量化仿真如何重塑多智能体强化学习?
gpu算力·强化学习