一、Agent Runtime / 内核(频次 10,最高频)
具体技术栈
表格
| 层级 | 技术 |
|---|---|
| 运行时语言 | Python(主流)、Rust(高性能内核)、TypeScript/Node.js |
| 核心机制 | 事件循环(asyncio)、上下文管理、工具调度、状态机、检查点(Checkpoint) |
| 协议层 | MCP(工具接入)、A2A(Agent 间通信)、OpenAI Function Calling |
| 存储 | SQLite/PostgreSQL(状态持久化)、Redis(缓存 / 队列) |
开源工程
表格
| 项目 | 特点 | 适用场景 |
|---|---|---|
| agiresearch/AIOS | COLM 2025 论文实现,内核 + SDK 分离架构,管理 LLM / 内存 / 存储 / 工具资源 | 学习 AIOS 内核设计、学术研究 |
| ElizaOS/eliza | AI 原生操作系统,模块化 Agent 架构,多插件生态 | 构建完整 AIOS 平台、多 Agent 协作 |
| Agent-OS-Kernel | Rust 实现的 Agent 操作系统内核,受《AI Agent 的操作系统时刻》启发 | 高性能内核、Rust 技术栈 |
| eumemic/aios | Postgres 持久化任务队列,append-only 事件日志,工具异步分离执行 | 生产级 durable Agent runtime |
| OpenAI Agents SDK | 官方 Agent 运行时,内置 handoff、guardrails、tracing | 快速构建生产级 Agent |
| LangGraph | 有向图状态机运行时,支持 checkpoint、HITL、流式输出 | 复杂流程控制的 Agent |
Demo 快速构建
最快路径:OpenAI Agents SDK + FastAPI
pip install openai-agents fastapi uvicorn
- 用
Agent类定义角色和工具,Runner.run()执行 - 用
handoffs实现多 Agent 交接 - FastAPI 包装成 HTTP 服务,前端用 SSE 流式接收
- 30 分钟可跑通一个带工具调用的 Agent 服务
进阶路径:LangGraph + LangGraph Platform
- 用
StateGraph画节点和边,compile()生成运行时 - 内置
MemorySaver做 checkpoint,支持中断恢复 - 适合演示 "可恢复、可中断、有人工介入" 的 Agent 流程
二、工具调用 / Tool Gateway(频次 9)
具体技术栈
表格
| 层级 | 技术 |
|---|---|
| 协议标准 | MCP(Model Context Protocol)、OpenAPI 3.1、JSON Schema |
| 函数调用 | OpenAI Function Calling、Anthropic Tool Use、Gemini Function Calling |
| 网关层 | 反向代理、工具注册中心、权限校验、审计日志 |
| 实现语言 | Python(FastMCP)、TypeScript、Go、Rust |
开源工程
表格
| 项目 | 特点 |
|---|---|
| MCP (Anthropic) | 模型上下文协议标准,含 Python/TypeScript SDK,工具发现 + 调用统一规范 |
| FastMCP | Python 最快的 MCP Server 框架,装饰器注册工具,几行代码出 Server |
| mcp-gateway (Rust) | 单二进制聚合多个 MCP Server,Agent 只看到 14-16 个元工具,不撑爆上下文 |
| mcp-gateway (Go) | Go 实现,stdio 子进程管理 MCP Server,健康检查 + Prometheus 指标 |
| AgentGateway OSS | MCP 多路复用,单端点聚合所有工具,支持权限过滤 |
| strato-space/agent-mcp-gateway | 带 agent_id 权限隔离的 MCP 网关,按 Agent 过滤可见工具 |
Demo 快速构建
方案 A:FastMCP 快速搭一个工具网关
pip install fastmcp
from fastmcp import FastMCP
mcp = FastMCP("my-tools")
@mcp.tool()
def search_web(query: str) -> str:
"""搜索网页"""
return f"搜索结果: {query}"
@mcp.tool()
def calculator(expression: str) -> float:
"""计算器"""
return eval(expression)
mcp.run()
- 用 Claude Desktop / Cursor 连接这个 MCP Server,即可验证工具调用
- 10 分钟出 Demo
方案 B:MCP Gateway 聚合演示
- 启动 2-3 个 FastMCP Server(天气、搜索、数据库)
- 用
mcp-gateway聚合,展示 "一个端点调用所有工具" - 配合 OpenAI Agents SDK 的
MCPClient做端到端调用链演示
三、记忆与上下文管理(频次 8)
具体技术栈
表格
| 层级 | 技术 |
|---|---|
| 短期记忆 | 滑动窗口、摘要压缩、Token 计数(tiktoken) |
| 长期记忆 | 向量检索(RAG)、知识图谱、结构化事实存储 |
| 向量数据库 | Milvus、Qdrant、Chroma、pgvector、Weaviate |
| 嵌入模型 | text-embedding-3、bge-m3、m3e、jina-embeddings |
| 图谱数据库 | Neo4j、FalkorDB、Kuzu |
开源工程
表格
| 项目 | Stars | 特点 |
|---|---|---|
| Mem0 | ~59k | 通用记忆层,向量 + 图谱 + KV 混合存储,自动提取事实,三行代码接入,框架无关 |
| Letta (原 MemGPT) | ~23k | OS 式分页记忆(core/recall/archival 三层),Agent 自主管理记忆,git-tracked memory |
| Zep / Graphiti | - | 时序知识图谱,每条边带 valid_from/valid_to,时序推理与合规审计最强,支持 MCP |
| MemGPT | - | 虚拟内存机制,自动在上下文和外部存储间换页 |
Demo 快速构建
最快路径:Mem0 + 任意 Agent 框架
pip install mem0ai
from mem0 import Memory
m = Memory()
m.add("用户李一航,武汉江夏区,关注AI OS和车载部署", user_id="yihang")
result = m.search("李一航关注什么技术", user_id="yihang")
- 接入 OpenAI Agents SDK / LangChain,每次对话后自动
m.add(),回复前m.search()注入上下文 - 15 分钟演示 "跨会话记住用户偏好"
进阶路径:Letta 状态化 Agent
pip install letta,启动 Letta Server- 创建 Agent 时配置记忆,Agent 自主决定何时写入 / 归档记忆
- 适合演示 "Agent 自己管理记忆、跨进程重启记忆存活"
四、多 Agent 协同调度(频次 8)
具体技术栈
表格
| 层级 | 技术 |
|---|---|
| 通信协议 | A2A(Google Agent2Agent)、ACP(已与 A2A 合并入 Linux Foundation) |
| 编排模式 | 顺序执行、层级调度(Manager-Worker)、对等协作(GroupChat)、DAG |
| 消息传递 | HTTP + SSE、JSON-RPC、消息队列(Redis/Kafka) |
| 服务发现 | Agent Card(JSON 元数据)、注册中心 |
开源工程
表格
| 项目 | 特点 |
|---|---|
| A2A Protocol (Google) | 2025.4 开源,Agent 间标准化通信,Agent Card 发现 + JSON-RPC 消息,50+ 合作伙伴 |
| CrewAI | 角色扮演式多 Agent,定义 Role/Task/Crew,sequential/hierarchical 两种流程 |
| AutoGen / Agent Framework | 微软多 Agent 对话框架,GroupChat 辩论式协作,适合代码生成场景 |
| LangGraph Multi-Agent | 有向图编排多 Agent,支持 supervisor、handoff、网络拓扑 |
| A2A-Orchestrator | A2A 协议编排器,HTTP 通信,自动发现 Agent Card |
| A2A-MCP-Server | 桥接 MCP 和 A2A,让 MCP Client 发现和调用 A2A Agent |
| Amazon Bedrock AgentCore Runtime | 支持 A2A,跨框架(LangGraph/OpenAI Agents/Claude Agents)Agent 互通 |
Demo 快速构建
方案 A:CrewAI 角色扮演团队(最快)
pip install crewai
- 定义 3 个 Agent:研究员(搜索工具)、分析师(推理)、写手(生成报告)
Crew(agents=[...], tasks=[...], process=Process.sequential)一键运行- 20 分钟出 "AI 团队写行业简报"Demo
方案 B:A2A 协议跨 Agent 通信(技术深度)
- 用 Google A2A Python SDK 启动两个 Agent Service(各带
/agent-card端点) - Agent A 通过
create_from_url()发现 Agent B,send_message()委托任务 - 演示 "不同框架构建的 Agent 通过标准协议协作"
- 适合汇报中展示 "协议层解耦" 的技术先进性
五、模型网关 / Model Gateway(频次 6)
具体技术栈
表格
| 层级 | 技术 |
|---|---|
| 统一接口 | OpenAI 兼容 API(事实标准) |
| 路由策略 | 负载均衡、故障转移(Fallback)、按成本 / 延迟路由、灰度 |
| 管控能力 | 虚拟 Key、限流(Rate Limit)、预算控制、Token 计费 |
| 部署 | Docker、Kubernetes、Helm |
开源工程
表格
| 项目 | 定位 | 核心能力 |
|---|---|---|
| LiteLLM Proxy | 轻量级 LLM Gateway | 100+ Provider 统一接口、负载均衡、Fallback、虚拟 Key、成本追踪,15k+ Stars |
| One API / New API | API 聚合分发 | 中文社区最活跃,渠道管理、令牌计费、用户系统,部署最简单 |
| Portkey | 企业级 AI Gateway | 1600+ LLM、可观测性、Guardrails、Prompt 管理、MCP 集成,开源核心 |
| Helicone | LLM 可观测性网关 | 一行 base_url 替换,日志 + 成本 + 追踪 |
Demo 快速构建
最快路径:LiteLLM Proxy Docker 一键启动
docker run -e OPENAI_API_KEY=xxx -e ANTHROPIC_API_KEY=xxx \
-p 4000:4000 ghcr.io/berriai/litellm:main-latest \
--config /app/config.yaml
- 配置文件里写多个模型渠道,设置
fallback_models和routing_strategy - 客户端只连
http://localhost:4000,用 OpenAI SDK 调用任意模型 - 演示 "一个端点调用 GPT/Claude/Gemini,自动故障转移"
- 10 分钟出 Demo
六、安全边界 / 沙箱(频次 6)
具体技术栈
表格
| 隔离层级 | 技术 | 隔离强度 |
|---|---|---|
| 容器级 | Docker(namespace + cgroup) | 中,启动~500ms |
| 用户态内核 | gVisor | 中高,启动~100ms |
| 微虚拟机 | Firecracker MicroVM | 高,启动~125ms |
| 权限控制 | seccomp、AppArmor、能力裁剪、只读文件系统 | - |
| 网络隔离 | 独立网络命名空间、出站白名单、代理审计 | - |
开源工程
表格
| 项目 | 特点 |
|---|---|
| E2B | 事实标准 Agent 沙箱,Firecracker MicroVM,完整 Linux 环境,开源 SDK,支持模板 |
| CubeSandbox (腾讯云) | 基于 RustVMM 的 MicroVM 沙箱,兼容 E2B SDK,国内可自托管 |
| agent-sandbox | 开源自托管沙箱,K8s 一键部署,无 etcd/DB/MQ 依赖 |
| OpenSandbox | 开源 MicroVM 沙箱方案 |
| Docker 自建 | docker run --read-only --cap-drop=ALL --network=none 快速搭建代码执行沙箱 |
Demo 快速构建
方案 A:E2B 沙箱代码执行(最快)
pip install e2b
from e2b import Sandbox
sandbox = Sandbox()
output = sandbox.commands.run("python3 -c 'print(1+1)'")
print(output.stdout) # 2
sandbox.close()
- 演示 "Agent 生成的代码在隔离沙箱中执行,无法访问宿主机"
- 配合文件写入、网络访问控制展示安全边界
- 15 分钟出 Demo
方案 B:Docker 自建沙箱(自托管展示)
- 用 Docker Python SDK,每次执行创建
--read-only --cap-drop=ALL --pids-limit=32的容器 - 挂载临时目录写入代码,执行后销毁
- 适合汇报中展示 "零依赖自建安全执行环境"
七、任务调度与编排(频次 5)
具体技术栈
表格
| 层级 | 技术 |
|---|---|
| 工作流引擎 | 有向图(DAG)、状态机、事件驱动 |
| 持久化执行 | Checkpoint、Durable Execution、故障恢复 |
| 任务队列 | Celery、RQ、BullMQ、Temporal |
| 人机协作 | HITL(Human-in-the-Loop)中断点、审批流 |
开源工程
表格
| 项目 | 核心抽象 | 适用场景 |
|---|---|---|
| LangGraph | StateGraph + Checkpoint | 生产级编排、HITL、可恢复流程,最灵活 |
| CrewAI Flows | 事件驱动(@start/@listen/@router) | 顺序为主的工作流,比图更轻量 |
| Prefect | Flow + Task,重试 / 日志 / 调度 | 数据管道 + Agent 混合工作流 |
| Temporal | Durable Execution,工作流即代码 | 企业级长时运行任务,故障自动恢复 |
| Temporal + LangGraph Plugin | LangGraph 图跑在 Temporal Workflow 上 | 生产级 durable Agent 执行 |
Demo 快速构建
最快路径:LangGraph 状态机
from langgraph.graph import StateGraph, END
from typing import TypedDict
class State(TypedDict):
input: str
output: str
def node1(state): return {"output": state["input"].upper()}
def node2(state): return {"output": state["output"] + "!"}
graph = StateGraph(State)
graph.add_node("step1", node1)
graph.add_node("step2", node2)
graph.set_entry_point("step1")
graph.add_edge("step1", "step2")
graph.add_edge("step2", END)
app = graph.compile()
print(app.invoke({"input": "hello"}))
- 加
MemorySaver做 checkpoint,演示中断恢复 - 加条件边
add_conditional_edges演示分支路由 - 20 分钟出 "可恢复、可分支" 的工作流 Demo
八、评测与可观测性(频次 4)
具体技术栈
表格
| 层级 | 技术 |
|---|---|
| 追踪标准 | OpenTelemetry(Trace/Span/Generation) |
| 数据模型 | Trace → Span → Observation(LLM/Tool/Retrieval) |
| 评测方法 | LLM-as-Judge、规则匹配、人工标注、A/B 实验 |
| 指标 | Token 消耗、延迟、成功率、工具调用准确率、成本 |
| 可视化 | Trace 瀑布图、Agent 图可视化、Prompt 版本对比 |
开源工程
表格
| 项目 | 协议 | 特点 |
|---|---|---|
| Langfuse | MIT,OTel 原生 | 20k+ Stars,追踪 + 评估 + Prompt 管理 + 成本分析,Agent 图可视化,自托管 |
| Phoenix (Arize) | 开源,OTel 标准 | 单 Docker 部署,40+ 评估指标,RAG 检索相关性视图,Prompt Playground |
| Opik (Comet) | Apache-2.0,OTel 兼容 | Trace/Span 模型,实验管理,相对轻量 |
| OpenTelemetry GenAI | CNCF 标准 | 语义约定规范,与 Jaeger/Zipkin 等现有 APM 集成 |
Demo 快速构建
最快路径:Langfuse Docker 一键启动 + OpenAI 集成
docker compose up -d # langfuse + postgres
- Python 端
from langfuse.openai import openai,一行替换即可自动追踪 - 运行几次 Agent 调用,在 Langfuse UI 查看 Trace 瀑布图、Token 成本、工具调用详情
- 配置一个 LLM-as-Judge 评分规则,自动评估输出质量
- 20 分钟出 "全链路追踪 + 自动评测"Demo
九、端侧 / 车载部署(频次 4)
具体技术栈
表格
| 层级 | 技术 |
|---|---|
| 推理引擎 | llama.cpp(GGUF)、ONNX Runtime、MLC-LLM(TVM)、Qualcomm SNPE/QNN |
| 量化 | INT4/INT8 量化(GPTQ、AWQ、GGUF Q4_K_M)、蒸馏 |
| 端侧模型 | Qwen2.5-0.5B/1.5B、Llama-3.2-1B/3B、Phi-3-mini |
| 车规芯片 | 高通 SA8295P(Hexagon NPU)、地平线 J5、恩智浦 i.MX8 |
| 部署形态 | 本地推理(离线)、边云协同(动态卸载)、OTA 模型热更新 |
| 封装 | Ollama(预编译 runtime)、FastAPI(OpenAI 兼容接口)、OpenWebUI |
开源工程
表格
| 项目 | 特点 |
|---|---|
| llama.cpp | 跨平台最广,GGUF 模型即拉即跑,server 模式原生 OpenAI 兼容 + 流式 |
| MLC-LLM | TVM 编译优化,支持高通 Adreno GPU OpenCL 加速,QCS6490/SA8295 适配 |
| ONNX Runtime | 跨平台推理,集成 QNN SDK 调用高通 NPU,INT4 算子支持 |
| Ollama | 预编译 LLM runtime,ARM64 一键安装,适合车机 Linux 快速验证 |
| Qualcomm SNPE / QNN | 高通原生工具链,模型转换 + 量化 + Hexagon NPU 硬件调度 |
Demo 快速构建
方案 A:llama.cpp + Qwen-0.5B 端侧推理(最快)
# 车机/ARM 设备上
curl -fsSL https://ollama.com/download/ollama-linux-arm64.tar.zst | tar x
ollama run qwen2.5:0.5b
- 用
llama-server启动 OpenAI 兼容 API,端口 8080 - 车载语音助手前端调用本地端点,演示 "离线、低延迟(<500ms)"
- 在 x86 开发机上 10 分钟可模拟,ARM 设备上交叉编译后部署
方案 B:SA8295P NPU 加速演示(技术深度)
- 用 ONNX Runtime + QNN Execution Provider
- 模型转换:PyTorch → ONNX → QNN context binary
- 对比 CPU vs NPU 推理延迟(NPU 通常 3-5x 加速)
- 适合汇报中展示 "车规级硬件加速" 的工程能力
总结:Demo 汇报组合建议
如果要做一次完整的 AIOS 技术汇报,建议用以下组合快速搭建端到端 Demo:
表格
| Demo 主题 | 技术组合 | 搭建时间 | 展示亮点 |
|---|---|---|---|
| AIOS 内核运行时 | OpenAI Agents SDK + FastAPI | 30min | Agent 自主决策 + 工具调用 + 流式输出 |
| 多 Agent 协作 | CrewAI 或 A2A 双 Agent | 20min | 研究员→分析师→写手 流水线 |
| 工具网关 | FastMCP × 3 + mcp-gateway | 15min | 单端点聚合多工具,权限隔离 |
| 长期记忆 | Mem0 + Agent | 15min | 跨会话记住用户偏好 |
| 安全沙箱 | E2B + 代码生成 Agent | 15min | AI 写代码在隔离环境执行 |
| 模型网关 | LiteLLM Proxy + 多模型 | 10min | 一个 API 调所有模型,自动故障转移 |
| 可观测性 | Langfuse + 上述全链路 | 20min | Trace 瀑布图 + 成本 + 自动评测 |
| 端侧部署 | llama.cpp + Qwen-0.5B | 15min | 离线低延迟推理 |
核心主线建议:以 "一个 Agent 从接收任务→调度子 Agent→调用工具→沙箱执行→记忆沉淀→全链路可观测" 为故事线,把 8 个模块串成一个端到端 Demo,比单独展示每个模块更有说服力。