技术栈
zero rl
我是小邵
4 小时前
强化学习
·
大模型训练
·
grpo
·
zero rl
Zero RL:当 AI 学会“顿悟“——零强化学习的狂欢与阵痛
发布日期:2026-07-27 阅读时间:约 15-18 分钟 分类:技术杂谈 专栏:未归档 关键词:强化学习 Zero RL DeepSeek GRPO 大模型训练 推理模型
我是有底线的