强化学习RL实战 01:RoboCup Rescue simulator

相关推荐
盼小辉丶2 天前
PyTorch强化学习实战——用预训练语言模型和ChatGPT玩转文本游戏
pytorch·深度学习·语言模型·chatgpt·强化学习
林间码客4 天前
Agentic-RL:从SFT到GRPO,让智能体学会“自主进化”
sft·强化学习·grpo·agentic-rl
XLYcmy5 天前
小红书 算法一面 四
深度学习·llm·sft·强化学习·多模态·grpo·奖励函数
TechEdu2026065 天前
[人工智能]Tianshou强化学习框架:概念、架构与工程实践
人工智能·ai·rl
盼小辉丶5 天前
PyTorch强化学习实战(22)——将强化学习应用于TextWorld互动小说游戏
pytorch·深度学习·强化学习
XLYcmy6 天前
小红书 算法一面 三
llm·sft·强化学习·多模态·损失函数·visual r1·奖励机制
chen_zn957 天前
《VLA 系列》RLT | RL Token | 轻量 Actor-Critic | 在线强化学习与源码解析
人工智能·强化学习·具身智能·vla
计科杨某人8 天前
机器学习基本常识
随机森林·机器学习·支持向量机·监督学习·强化学习·最小二乘法·无监督学习
云和数据.ChenGuang10 天前
fastapi项目拆分实战数据模型
java·服务器·数据库·人工智能·深度学习·fastapi·强化学习
林泽毅17 天前
PyTRIO快速入门实战篇(二):用 GRPO 提升 GSM8K 数学推理准确率
人工智能·深度学习·机器学习·llm·强化学习