技术栈

colm 2025

白拾
12 天前
强化学习·colm 2025·search-r1 论文分享·llm后训练·检索增强推理
【COLM 2025】Search-R1:强化学习让大模型学会边推理边搜索|从LLM检索增强推理视角本文解读 COLM 2025 论文《Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning》。该论文提出 Search-R1 强化学习框架,通过融合搜索引擎环境建模、检索 token 损失掩码与纯结果奖励,让大语言模型在推理过程中自主发起多轮搜索、整合实时信息,其特别之处在于不需要任何人工标注轨迹或过程监督。实验表明 7B 与 3B 模型相对 RAG 基线平均提升 24% 与 20
白拾
21 天前
资源调度·aios 论文分享·llm agent·智能体操作系统·colm 2025
【COLM 2025】AIOS:LLM 智能体操作系统,内核化资源管理与调度|从智能体系统架构视角本文解读 COLM 2025 论文《AIOS: LLM Agent Operating System》。该论文提出AIOS 智能体操作系统,通过融合操作系统内核思想、系统调用抽象与SDK 开发套件,把 LLM 与工具资源从智能体应用中隔离出来统一管理,其特别之处在于让并发智能体像进程一样被调度与隔离。实验表明接入 AIOS 后吞吐最高提升 2.1 倍,并发智能体从 250 个扩展到 2000 个仍保持近似线性性能,为规模化 LLM 智能体服务提供了系统级基础设施借鉴。
我是有底线的