从 TinyZero 到 APR:语言模型推理能力的探索与自适应并行化

https://mp.weixin.qq.com/s/IKzCkR7hzfctcK0c0DbBCA

TinyZero是首个DeepSeek R1-Zero的干净、简洁、易于获取的全开源复现,目前已11.6k Star。同时,它只需 30 美元就能模拟花费600万美元的DeepSeek R1-Zero 的推理。

TinyZero 以字节的RLHF训练框架veRL为基础进行构建,采用 DeepSeek R1-Zero 算法,通过强化学习在没有监督微调的情况下实现了 3B 参数的大语言模型的自我思维验证和搜索能力。

复制代码
https://github.com/Jiayi-Pan/TinyZero

4月22日上午9点 ,青稞Talk 第46期,UC Berkeley 博士生、TinyZero项目作者潘家怡和APR合作者李岫宇,将直播分享《从 TinyZero 到 APR:语言模型推理能力的探索与自适应并行化》。

APR(Adaptive Parallel Reasoning)是潘家怡博士和李岫宇博士,在Long CoT模型并行化加速方面提出自适应并行推理框架。

APR 通过多线程控制原语(spawn() 和 join())动态协调串行与并行推理流程,并基于端到端强化学习联合优化主从线程推理路径,实现无预设结构的计算资源自主调度。

在 Countdown 推理任务中,APR 展现出显著优势:4k 上下文窗口内成功率提升 23.4%(83.4% vs. 60.0%),20k 总 token 计算量时成功率提高 13.5%(80.1% vs. 66.6%),5 秒延迟条件下准确率提升 17.9%。

该框架为语言模型通过自适应分配并行计算资源优化推理效能提供了系统性解决方案。

分享嘉宾

李岫宇,UC Berkeley 博士生,导师为 Kurt Keutzer 教授,此前本科毕业于康奈尔大学。现主要研究方向为大语言模型 reasoning,后训练和高效推理。个人主页:xiuyuli.com

潘家怡,UC Berkeley 博士生,导师为 Alane Suhr教授,此前本科毕业于上海交通大学和密西根大学。现主要研究方向为大语言模型后训练方向,通过强化学习等方式提高模型在Agent和Reasoning上的能力。个人主页:jiayipan.com

主题提纲

从 TinyZero 到 APR:语言模型推理能力的探索与自适应并行化

1、TinyZero: 低成本复现 DeepSeek R1 Zero Aha moment

2、大语言模型传统 CoT 推理中的挑战

3、APR: 自适应并行推理框架介绍

4、端到端强化学习驱动优化

直播时间

4月22日上午9:00 - 10:00

相关推荐
AI备案指南-满满几秒前
iPhone 18 的 Siri 跟以前到底有什么不一样?
人工智能·ai·生成式ai·大模型备案
昇腾知识体系2 分钟前
vLLM-Ascend 支持矩阵:supported_models 模型列表、BF16/ACLGraph 支持项核对方法
人工智能·华为·知识图谱·vllm
蓝速科技3 分钟前
信创终端 POC 测试实战与选型避坑指南丨蓝速科技
运维·数据库·人工智能·科技·自然语言处理
知几蜗牛6 分钟前
本地语音AI不等于零风险:VoiceStudio最值得看的三条边界
人工智能
知几蜗牛7 分钟前
Claude接入十余种金融系统后,真正稀缺的是可追溯的审批链
人工智能
天远API13 分钟前
零信任架构实战:基于天远单人婚姻查询构建自动化联合贷款审计网关
java·人工智能·架构·自动化
远航计算机14 分钟前
网站被 AI 收录要多久?从被抓取到被引用的完整时间表
大数据·人工智能·aigc
昨日之日200617 分钟前
AuK:多任务语音生成编辑,支持克隆、改词、换情绪与分离,内容编辑与增强全覆盖
人工智能·音视频
知几蜗牛23 分钟前
4万星的Agent技能提醒我们:答案太全也可能不可用
人工智能
智购科技无人售货机工厂24 分钟前
2026自动售货机AI智能体架构:从47个小模型到33.7亿Token的工程实践~YH
android·人工智能·驱动开发·单片机·pandas