【COLM 2025】AIOS:LLM 智能体操作系统,内核化资源管理与调度|从智能体系统架构视角

摘要

本文解读 COLM 2025 论文《AIOS: LLM Agent Operating System》。该论文提出AIOS 智能体操作系统 ,通过融合操作系统内核思想系统调用抽象SDK 开发套件 ,把 LLM 与工具资源从智能体应用中隔离出来统一管理,其特别之处在于让并发智能体像进程一样被调度与隔离。实验表明接入 AIOS 后吞吐最高提升 2.1 倍,并发智能体从 250 个扩展到 2000 个仍保持近似线性性能,为规模化 LLM 智能体服务提供了系统级基础设施借鉴。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) AIOS: LLM Agent Operating System
标题(中文) LLM 智能体操作系统:内核化资源管理与调度
作者 Kai Mei, Xi Zhu, Wujiang Xu, Mingyu Jin, Wenyue Hua, Zelong Li, Shuyuan Xu, Ruosong Ye, Yingqiang Ge, Yongfeng Zhang
机构 Department of Computer Science, Rutgers University
会议 COLM 2025
arXiv https://arxiv.org/abs/2403.16971
项目网站 https://github.com/agiresearch/AIOS

背景与动机:为什么智能体需要自己的操作系统

LLM 智能体在真实任务中既要调用大模型服务(偏好检索、接口选择、回复生成),也要使用传统操作系统服务(文件、存储)。但现有智能体框架(AutoGen、LangChain 等)让智能体直接访问 LLM 与工具资源,带来三类问题:

  • 无调度导致资源独占:一个智能体可以淹没 LLM 请求,其他智能体只能等待;
  • 并发场景反复试错:提示词被转成张量加载进显存,直到触发 CUDA 显存上限异常再释放重试,严重拖慢吞吐;
  • 缺乏隔离与访问控制:直接暴露系统级资源带来安全隐患。

AIOS 的解法是把操作系统演进史(批处理 → 分时 → 多任务 → 模块化内核)的思想搬到智能体场景:LLM 被视作类似 CPU 核心的资源,由内核统一调度、隔离与恢复。与 MemGPT 等只做单点记忆管理的工作不同,AIOS 提供完整的内核抽象------这正是它与既有工作最本质的差异。

研究主线:从问题到结论

图 1:AIOS 论文的研究主线 ------ 从并发瓶颈到内核化资源管理的完整推理链

基准/方法设计:三层架构与七模块内核

AIOS 采用经典的三层架构:

图 2:旅行智能体完成任务需要 LLM 服务(红)与 OS 服务(蓝)协同 ------ AIOS 将两者统一纳入内核管理

  • 应用层:AIOS SDK 提供统一接口,既支持原生 agent 开发,也通过适配器接入 ReAct、Reflexion、AutoGen、Open-Interpreter、MetaGPT 五大框架;
  • 内核层:AIOS Kernel 含调度器、LLM Core、上下文管理、内存管理、存储管理、工具管理、访问管理七模块;
  • 硬件层:CPU/GPU/磁盘,AIOS 通过传统 OS 系统调用间接访问,不直接操作硬件。

核心机制是查询分解:智能体查询被拆成多个 AIOS 系统调用(syscall),由调度器分发到对应模块执行,实现并行与有序处理。

分类全景:AIOS 内核的七大模块

图 3:AIOS 内核七大模块 ------ LLM 核心、调度、上下文、内存、存储、工具、访问管理

方法细节:系统调用与调度机制

图 4:AIOS 三层架构 ------ 应用层通过 SDK 访问内核层,内核统一管理 LLM 核心、调度与各类资源

  • LLM Core:统一接口封装不同 LLM 端点(API/本地),视作"核心"便于调度与切换;
  • Agent Scheduler:RR/FIFO 策略调度系统调用,支持抢占式执行 + 上下文快照恢复;
  • Context Manager:长上下文生成中断时快照并恢复,防止长请求独占 LLM 核心;
  • Memory/Storage Manager:短期对话记忆与长期交互日志持久化分层管理;
  • Tool/Access Manager:工具加载与调用冲突消解、访问控制与用户干预协议。

图 5:Agent 查询分解为 AIOS 系统调用,由调度器按策略分发到各执行模块(访问类调用不经过调度器)

每个模块通过系统调用对外提供服务(如 memory_store、tool_call、context_snapshot),智能体经由 SDK 透明调用------与操作系统 syscall 同构,应用无需关心资源细节。

实验设计与结果

评测协议:LLM Core 用 GPT-4o-mini(API)+ Llama-3.1-8b / Mistral-7b(本地 fp16,单张 RTX A5000);默认 250 个智能体并发、RR 调度;成功率 SR% 为统一指标;覆盖 HumanEval(代码生成)、MINT-Code(多轮交互代码)、GAIA(通用助手工具调用)、SWE-Bench-Lite(软件工程修复)四基准。

主表:五个框架接入 AIOS 前后成功率(SR%,括号为相对无 AIOS 的提升)

框架 (w/ AIOS) HumanEval MINT GAIA SWE-Lite
ReAct 50.6 (+1.8) 30.1 (+0.7) 7.3 (+1.8) 4.3 (+0.4)
Reflexion 51.8 (+1.2) 33.8 (+1.4) 7.8 (+1.1) 5.1 (+0.4)
Autogen 87.8 (0) 42.5 (0) 9.7 (+2.4) 4.3 (0)
Open-Interpreter 86.0 (+0.6) 48.7 (+2.8) --- 5.1 (+0.4)
MetaGPT 82.9 (0) 41.8 (+0.7) --- 5.9 (0)

所有框架性能保持或提升,工具调用型基准 GAIA 提升最显著(最高 +2.4pp)。增益来自三机制:结构化 prompt 增强、工具调用参数预校验(正则)、冲突消解哈希表。

图 6:Llama-3.1-8b 上各框架归一化吞吐 ------ AIOS 显著更高(Reflexion 达 2.1×)

扩展性实验:并发智能体从 250 增至 2000,总体执行时间与平均等待时间均近似线性增长,且与无 AIOS 的差距随并发数扩大持续拉大------高并发下优势更明显。

图 7:并发 agent 从 250 增至 2000 ------ 总体执行时间与平均等待时间近似线性,AIOS 差距随并发扩大

附加实验:Mistral-7b 本地模型上重复吞吐/延迟实验趋势与 Llama 一致,确认效率收益与具体模型无关;FIFO 调度策略与默认 RR 差异可控。

图 8:Mistral-7b 上各框架归一化吞吐 ------ AIOS 同样显著提升,验证跨模型普适性

结果对比总结

图 9:AIOS 结果对比总结 ------ 吞吐 2.1×、GAIA +2.4pp、并发近似线性扩展

关键发现

Oral 信号分析 :从创新模式视角看,AIOS 命中两个高 Oral 率模式------P6 重新表述为可解对象 (n=79,Δ_OR=+2.9pp,Δ_OH=+7.1pp):把并发智能体共享 LLM 的难题重构为内核资源调度问题,LLM 视作类 CPU 核心,证据是 250→2000 并发近似线性扩展与 2.1× 吞吐;P11 分解并委托求解器(n=42,增长最快 τ=+6.3pp):查询分解为系统调用后由调度器委托专门模块执行,证据是 GAIA 最高 +2.4pp 且五框架性能无一回退。系统类贡献以可复用基础设施 + 大规模受控实验构成完整证据链。

  • 性能保持或提升:5 个框架 × 4 个基准全部 SR% 无回退,Open-Interpreter 的 MINT 提升 +2.8pp(45.9→48.7);
  • 吞吐最高 2.1 倍:Reflexion 框架在 Llama-3.1-8b 上执行加速最显著,源于避免显存试错;
  • GAIA 工具调用提升显著:AutoGen +2.4pp(7.3→9.7),得益于参数预校验与冲突消解;
  • 近似线性扩展:并发 250→2000,执行时间与等待时间线性增长,无 AIOS 差距随并发扩大;
  • 跨模型普适:Llama-3.1-8b 与 Mistral-7b 上吞吐/延迟收益一致;
  • 即插即用:SDK 适配器机制让 5 大框架接入零侵入。

局限性

  • 单 GPU 单模型串行:默认一次只处理一个请求,未覆盖多模型并行/分布式推理;
  • 调度策略简单:仅 RR/FIFO,未探索优先级、负载感知等更智能策略;
  • 访问控制基础:Access Manager 提供基础鉴权,安全与隐私保障仍待加强;
  • 覆盖有限:5 框架 × 4 基准,通用性需要更大生态验证。

作者明确的多 LLM 分布式资源管理、更智能调度与多智能体协作安全是未来方向。

常见问题(FAQ)

AIOS 和 AutoGen、LangChain 有什么区别?

AutoGen 等框架聚焦智能体编排逻辑,把 LLM 当外部 API 调用;AIOS 把 LLM 当作类似 CPU 核心的内核资源,统一调度、隔离与恢复,并可通过适配器让这些框架直接接入受益。

AIOS 如何提升并发吞吐?

核心是调度器避免"提示词装不上显存"的反复试错:请求被分解为系统调用统一排队,配合上下文快照实现抢占式执行,最高带来 2.1 倍吞吐提升。

AIOS 对智能体性能有损吗?

没有。四个基准 × 五个框架的成功率全部保持或提升,工具调用型基准 GAIA 最高 +2.4pp,性能增益来自 prompt 结构化增强与工具调用预校验。

AIOS 支持哪些智能体框架?

ReAct、Reflexion、AutoGen、Open-Interpreter、MetaGPT 五大框架均通过适配器接入,原生 agent 也可直接使用 AIOS SDK 开发。

AIOS 开源吗?

是的,代码在 GitHub agiresearch/AIOS 组织下开源,这是其作为可复用基础设施被社区广泛引用的基础。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

相关推荐
陈晨辰熟稳重1 年前
20250704-基于强化学习在云计算环境中的虚拟机资源调度研究
云计算·强化学习·资源调度
河西石头2 年前
双向链表在系统调度、游戏、文本编辑及组态方面的应用
游戏·链表·文本编辑器·双向链表·资源调度·组态软件·系统调度
青云交2 年前
大数据新视界 -- Hive 与其他大数据工具的集成:协同作战的优势(上)(13/ 30)
sql·案例分析·资源调度·挑战应对·hive 集成·大数据工具·协同优势
Amd7942 年前
深入理解Python多进程:从基础到实战
性能优化·并发编程·错误处理·异步编程·资源调度·python并发库·多进程管理
嘻哈记2 年前
【k8s资源调度-Deployment】
kubernetes·pod·资源调度·deploy·replicasets
嘻哈记2 年前
【k8s资源调度-HPA(自动扩缩容)】
kubernetes·hpa·自动扩缩容·资源调度