技术栈

zero rl

我是小邵
4 小时前
强化学习·大模型训练·grpo·zero rl
Zero RL:当 AI 学会“顿悟“——零强化学习的狂欢与阵痛发布日期:2026-07-27 阅读时间:约 15-18 分钟 分类:技术杂谈 专栏:未归档 关键词:强化学习 Zero RL DeepSeek GRPO 大模型训练 推理模型
我是有底线的