Softmax Strategy

1. epsilon-greedy strategy

11111

2. UCB strategy

222

3. Softmax strategy

333

4. Gradient strategy

444

References

1 科学网---【RL系列】Multi-Armed Bandit笔记------Softmax选择策略 - 管金昱的博文

2 The Epsilon-Greedy Algorithm | James D. McCaffrey

相关推荐
盼小辉丶19 小时前
PyTorch强化学习实战——基于图像-文本融合的自动化网页导航
人工智能·pytorch·深度学习·自动化·强化学习
Mid_search19 小时前
Dueling Network
人工智能·深度学习·强化学习·dueling network
爱听歌的周童鞋1 天前
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 5 | Part 1 | 蒙特卡洛方法(通过例子介绍蒙特卡洛)
强化学习·大数定律·monte carlo·estimation·model-free·expectation
Mid_search1 天前
高估问题、Target Network、Double DQN
人工智能·深度学习·强化学习·double dqn·bootstrapping·target network
Mid_search2 天前
Experience Replay
人工智能·深度学习·强化学习·经验回放
爱听歌的周童鞋2 天前
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 4 | Part 3 | 值迭代与策略迭代(截断策略迭代算法)
强化学习·iteration·policy·truncated·value iteration
爱听歌的周童鞋4 天前
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 3 | Part 4 | 贝尔曼最优公式(最优策略的有趣性质)
强化学习·贝尔曼最优公式·optimal policy·invariance·shortest path
Mid_search5 天前
随机排列与Fisher-Yates算法
人工智能·深度学习·强化学习·随机排列·fisher-yates
夫唯不争,故无尤也6 天前
RL强化学习常见问题
强化学习·rl
深圳市爱派派智能科技有限公司6 天前
从英伟达 GPU 到 RK3566 实机:Microduck 25 厘米强化学习机器人部署手记
机器人·边缘计算·强化学习·rk3566·机器人英伟达