技术栈

lrm

缘友一世
15 天前
架构·llm·lrm·qwen4
Qwen3.8-Flash-Next(Qwen4架构预览模型)这几年大模型一直在「变大」:参数从几十亿涨到几千亿、甚至几万亿。按常理,模型越大,跑一次花的算力越多、速度越慢、成本越高。但2026年8月底,Qwen 团队放出的一台新模型,却讲了一个相反的故事:**参数巨大,但跑起来飞快、成本极低。**它就是 Qwen3.8-Flash-Next。
缘友一世
8 个月前
llm·gspo·大模型强化学习·lrm
Qwen GSPO算法的深入学习和理解GRPO 的局限:Token 级粒度的噪声问题,裁剪机制可能放大噪声。GRPO 依然沿用 Token 级别的更新粒度:
我是有底线的