技术栈
lrm
缘友一世
15 天前
架构
·
llm
·
lrm
·
qwen4
Qwen3.8-Flash-Next(Qwen4架构预览模型)
这几年大模型一直在「变大」:参数从几十亿涨到几千亿、甚至几万亿。按常理,模型越大,跑一次花的算力越多、速度越慢、成本越高。但2026年8月底,Qwen 团队放出的一台新模型,却讲了一个相反的故事:**参数巨大,但跑起来飞快、成本极低。**它就是 Qwen3.8-Flash-Next。
缘友一世
8 个月前
llm
·
gspo
·
大模型强化学习
·
lrm
Qwen GSPO算法的深入学习和理解
GRPO 的局限:Token 级粒度的噪声问题,裁剪机制可能放大噪声。GRPO 依然沿用 Token 级别的更新粒度:
我是有底线的