从英伟达 GPU 到 RK3566 实机:Microduck 25 厘米强化学习机器人部署手记机器人·边缘计算·强化学习·rk3566·机器人英伟达
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 3 | Part 1 | 贝尔曼最优公式(例子-如何改进策略)强化学习·贝尔曼最优公式·optimal policy·action value
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 3 | Part 2 | 贝尔曼最优公式(最优策略和公式推导)强化学习·贝尔曼最优公式·optimal policy·action value·maximization
git revert回退问题java·服务器·人工智能·git·fastapi·强化学习
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 2 | Part 4 | 贝尔曼公式(公式向量形式与求解)强化学习·贝尔曼公式·matrix-vector·closed-form·iterative