rl/swe/sft相关论文列表

Distributional Clarity: The Hidden Driver of RL-Friendliness in Large Language Models

简述:在用强化学习(Reinforcement Learning with Verifiable Rewards, RLVR)训练大语言模型时,不同模型家族存在显著差异:同样的训练流程下,Qwen 系列模型能获得巨大收益,而 Llama 系列则提升有限。这种差异被称为 "RL-Friendliness"(强化学习友好性)。

https://github.com/QwenLM/FlashQLA

最新算子库:FlashQLA (Flash Qwen Linear Attention)是 Qwen 团队开源的一个高性能线性注意力算子库,专门为 Qwen3.5/3.6 系列模型中的线性注意力机制做极致的 GPU 加速优化。

FlashQLA 基于 TileLang 构建,通过合理的算子融合和性能优化,作用于 GDN Chunked Prefill 的前向和反向传播,在 NVIDIA Hopper GPU 上相比 FLA Triton kernel 实现了前向 2-3 倍加速、反向 2 倍加速。在预训练场景和边缘侧 Agentic 推理场景中收益尤为明显。 github

(FLA 即 Flash Linear Attention)

相关推荐
10年前端老司机1 分钟前
耗时两周从零搭建私有化企业 RAG 知识库,完整架构与踩坑总结
人工智能·aigc·agent
liaiyang6681 分钟前
Python 3.14 手搓 Agent 记忆海关:AST 柔性扫描 + 双池隔离 + 可回滚审计
人工智能
EachYoungX2 分钟前
利用可控的风格迁移注入路径提供AI画面结构保持的思路
人工智能·计算机图形学
炒技鼠鼠王2 分钟前
Harness 为什么开始少用向量数据库了?
人工智能
IT_陈寒2 分钟前
Vue这个响应式陷阱我竟然踩了3次
前端·人工智能·后端
昨日之日20062 分钟前
【MiniMax H3】TaoMate-H3:3步LoRA让视频生成更快更高效,速度快10倍
人工智能·计算机视觉·音视频
IT_陈寒7 分钟前
Redis雪崩把我坑惨了,三招教你躲过去
前端·人工智能·后端
阿里云大数据AI技术7 分钟前
云栖2026|Agentic AI Infra,加速模型与智能体创新
人工智能·强化学习
Thneonl12 分钟前
99.9% 置信被拒收,76% 靠两个佐证进场
人工智能·架构
Thneonl12 分钟前
stateless 4/6 漏判,stateful 3/5 错杀:该信谁?
人工智能·架构