摘要
随着自主智能体(Agent)从实验室原型走向垂直行业生产落地,Hermes、OpenClaw、ClaudeCode 三类持久型智能体框架暴露出本地自建部署的系统性技术缺陷:硬件资源固定、进程保活逻辑复杂、租户隔离缺失、状态持久化成本高、运维链路冗长、扩缩容能力缺失。Agent 37 Cloud 作为专用托管运行平台,通过云原生微沙箱架构、单租户独占实例调度、标准化 Agent 生命周期管控、分层状态持久化引擎、统一 API 编排网关五大核心技术体系,彻底替代 Mac mini、自建 VPS 私有化部署方案。本文完全从底层工程、架构设计、性能优化、安全隔离、调度算法、兼容性适配、运维自动化等纯技术维度,完整拆解 Agent 37 Cloud 全链路实现逻辑,不涉及商业定价、市场推广等营销内容,覆盖底层虚拟化、内核隔离、长驻进程保活、多框架兼容 API、故障自愈、资源量化调度、存储分层等核心技术细节,并附带生产级部署对比、性能基准测试、底层源码逻辑、工程落地踩坑方案。
1 持久型 Agent 自建部署的底层技术瓶颈(Mac mini/VPS 方案缺陷)
在 Agent 37 Cloud 诞生前,开发者部署 Hermes、OpenClaw、ClaudeCode 持久型智能体仅有两条私有化路径:本地 Mac mini 集群部署、云厂商自建 VPS 集群,两种方案均存在不可调和的底层架构缺陷,也是托管平台核心技术解决的痛点。
1.1 Mac mini 本地硬件部署底层缺陷
Hermes、OpenClaw、ClaudeCode 均属于长驻有状态 Agent,区别于无状态 HTTP 接口服务,核心特征是进程 7×24 小时持续运行、维护独立内存上下文、本地文件系统记忆、定时后台任务、多轮会话状态留存,本地 Mac mini 硬件架构天然不匹配该负载:
- 硬件资源静态绑定,无弹性调度内核 Mac mini CPU、内存、存储为物理硬件固定分配,无法根据租户 Agent 活跃度动态释放算力。绝大多数垂直行业 Agent 日均活跃时长不足 10%,90% 时间进程处于空闲等待状态,但硬件资源持续占用,底层无休眠、冻结、资源回收机制,内核层面无法隔离多租户 Agent 进程,多客户 Agent 混跑时会出现 CPU 自旋、IO 争抢、内存溢出连锁崩溃问题。 传统 Mac mini 部署采用 PM2、systemd 做进程保活,仅停留在应用层进程监控,无内核级资源限制,当某一个 OpenClaw 执行批量文件遍历、Shell 脚本批量调用时,会耗尽磁盘 IO 带宽,挤压同硬件其他 Hermes 智能体消息处理延迟。
- 状态持久化无标准化 Checkpoint 引擎 本地部署仅依赖本地磁盘文件存储 Agent 会话、MEMORY.md、CLAUDE.md 上下文,无分层快照机制。硬件断电、系统重启、磁盘故障时,完整 Agent 执行链路全部丢失,Hermes 并行子 Agent 任务、OpenClaw 多渠道会话、ClaudeCode 代码仓库执行进度无法断点续跑;手动备份磁盘快照操作繁琐,无增量快照、跨节点迁移底层能力,工程上无法支撑数十、上百租户批量交付。
- 网络接入层无标准化租户 API 分发逻辑 Mac mini 暴露公网端口存在安全风险,手动配置 Nginx 反向代理、端口映射、鉴权中间件,每个客户 Agent 需要独立配置一套路由规则,不存在统一 API 网关做租户隔离、限流、权限校验、请求路由;每新增一个垂直领域客户,需要修改 Nginx 配置、重启服务,无法实现 "一次 API 调用自动分配专属 Agent" 的自动化能力。
- 硬件运维依赖人工介入,无自愈控制平面 Mac mini 无分布式集群管控,单设备故障会导致所有绑定 Agent 离线;进程崩溃后 PM2 仅支持简单重启,无法自动抓取崩溃快照、自动扩容备用硬件实例、故障租户 Agent 自动迁移至空闲设备;硬件磁盘、内存、CPU 负载无全局监控大盘,故障发现滞后数小时,完全依赖人工巡检、重启、重装环境,违背垂直客户批量交付无人运维的底层需求。
- 环境一致性无法标准化,框架依赖冲突 Hermes 基于 Node.js Runtime、ClaudeCode 深度绑定 Python 代码执行环境、OpenClaw 混合 TS 编译与 Shell 执行,多框架混跑时底层依赖版本冲突(Node 18/20、Python 3.10/3.12、系统工具包)。Mac mini 单系统环境无法做租户环境隔离,切换客户 Agent 时需要清理全局依赖,不存在镜像分层、按需加载运行时的底层技术。
1.2 自建 VPS 云服务器部署底层架构短板
基于 AWS EC2、阿里云 ECS、轻量 VPS 自建 Agent 集群,虽然解决硬件本地限制,但基于通用云服务器搭建持久 Agent 集群,存在架构层面的固有缺陷:
-
通用虚拟机调度不匹配长驻 Agent 负载 Kubernetes 原生调度面向无状态微服务、批处理任务设计,对长驻有状态 Agent 存在原生适配缺陷:
1)K8s Deployment 默认 Pod 空闲无休眠冻结机制,即使 Agent 无会话交互,内存、CPU 持续计费占用;
2)StatefulSet 有状态集群部署复杂度极高,需要手动绑定持久卷、维护固定网络标识,每个租户 Agent 独立创建一套 StatefulSet 资源,YAML 资源文件数量随租户线性膨胀;
3)原生调度无 Agent 预热池,新租户创建实例冷启动耗时 30s~120s,无法满足 API 调用秒级分配专属 Agent 的技术要求。 -
租户隔离仅停留在容器 Namespace,安全边界薄弱 普通 Docker 容器仅基于 Linux Namespace、Cgroups 做轻量隔离,内核共享,OpenClaw 支持执行任意 Shell 命令、文件读写,恶意租户可通过系统调用逃逸容器,读取其他租户 Agent 本地记忆文件、API 密钥、业务会话上下文;通用 VPS 集群无 MicroVM 内核级隔离,无法实现租户计算、存储、网络完全隔离。
-
状态存储分层缺失,读写性能与成本失衡 自建集群仅采用云硬盘统一存储所有 Agent 状态,未区分热态内存上下文、中频会话日志、冷态长期记忆,高频会话读写全走块存储 IO,延迟高;无内存快照、增量快照、对象存储归档分层逻辑,长期运行磁盘 IO 成本、读写延迟持续上涨。
-
API 分发层缺乏 Agent 专用协议适配 通用 API 网关(Nginx、Kong)仅支持标准 HTTP/WS 协议,未针对 Hermes 并行子 Agent 调度、OpenClaw 多渠道流式消息、ClaudeCode 长代码执行 SSE 流做协议优化;无法标准化封装 "单 API 创建专属租户 Agent" 的原子操作,创建实例需要串行调用调度、存储、网络、镜像多套接口,链路耗时过长,无事务一致性保障。
-
运维控制平面需要自研全链路自愈能力 自建集群需要工程师独立开发 Agent 生命周期监控、崩溃重启、资源回收、实例迁移、日志聚合模块,无原生适配持久 Agent 的自愈引擎;进程卡死、LLM 接口超时、工具调用阻塞等 Agent 特有故障场景,通用 K8s 探针无法精准识别,需要自定义复杂就绪 / 存活探针,研发成本极高。
1.3 两类自建方案统一底层痛点总结
| 技术维度 | Mac mini 本地部署 | 自建 VPS/K8s 集群 |
|---|---|---|
| 实例隔离强度 | 无隔离,多租户混跑 | 容器级弱隔离,内核共享 |
| 长驻进程保活 | 应用层 PM2,无内核冻结 | Pod 常驻,空闲资源不回收 |
| Agent 分配效率 | 人工配置分钟级 | 多接口串行创建,数十秒级 |
| 状态断点续跑 | 全量磁盘备份,无增量快照 | StatefulSet 持久卷,快照复杂 |
| 弹性扩缩容 | 无弹性,硬件固定 | 通用调度,无 Agent 预热池 |
| 自动化运维 | 零自愈,全人工操作 | 需自研自愈、监控、迁移模块 |
| 多框架兼容 | 全局环境依赖冲突 | 需自定义多镜像、版本隔离 |
| 租户 API 网关 | 手动反向代理,无标准化接口 | 通用网关,无 Agent 专用协议 |
上述全部底层技术痛点,构成 Agent 37 Cloud 平台的核心设计驱动:打造一款原生面向 Hermes、OpenClaw、ClaudeCode 持久型智能体的专用托管运行底座,从虚拟化、调度、存储、网关、适配层全链路重构底层技术,规避私有化部署的架构缺陷。
2 Agent 37 Cloud 核心定位与底层技术设计目标
2.1 平台技术定位
Agent 37 Cloud 并非通用 AI 模型托管、通用容器平台,是持久型有状态智能体专用运行时托管基础设施,技术边界严格限定 Hermes、OpenClaw、ClaudeCode 三类长驻 Agent 框架,核心技术定位拆解三层:
- 运行层:提供单租户独占 MicroVM 沙箱,为每一个客户分配独立、7×24 小时在线的隔离 Agent 实例,原生兼容三类框架原生 Runtime,无需修改 Agent 业务代码;
- 调度层:内置 Agent 专用分布式控制平面,替代人工服务器运维,自动化完成实例创建、休眠、唤醒、迁移、故障自愈、资源回收全生命周期管控;
- 接入层:标准化原子 API 协议,通过单次 HTTP/GraphQL API 请求完成租户专属 Agent 全链路分配(镜像拉取、沙箱创建、网络绑定、状态初始化、健康探测),对外屏蔽底层虚拟化、集群调度、存储复杂逻辑。
2.2 五大底层技术设计目标(纯工程维度,无商业指标)
目标 1:消除自建部署硬件 / 集群运维研发成本,平台内置完整自动化控制平面,零人工服务器操作;
目标 2:实现租户强隔离,内核级 MicroVM 隔离,杜绝跨租户进程、文件、网络数据泄露;
目标 3:优化长驻 Agent 资源利用率,空闲实例内存冻结、CPU 释放,仅保留持久化存储快照,平衡算力开销与状态连续性;
目标 4:标准化 Hermes/OpenClaw/ClaudeCode 多框架适配,统一 API 接口、状态存储、生命周期管理,一套调度底座兼容三类异构 Agent Runtime;
目标 5:原子化 API 租户实例创建,单请求完成专属 Agent 分配,链路耗时控制在亚秒至 3 秒区间,支持高并发批量创建垂直领域客户智能体。
3 兼容框架底层原理:Hermes、OpenClaw、ClaudeCode 运行时特征拆解
Agent 37 Cloud 底层调度、沙箱、存储模块全部针对三类框架的运行时特征定制优化,因此必须先拆解三类持久 Agent 底层运行机制,才能理解平台技术适配逻辑。
3.1 Hermes Agent 运行时底层特征
Hermes 是面向复杂多子 Agent 并行编排的通用持久智能体框架,底层运行核心特征:
- 双层进程模型:主 Agent 守护进程 + 多个并行子 Agent 独立协程,子 Agent 拥有独立上下文窗口,并行执行拆解任务,主进程统一汇总结果;进程长期驻留内存,维护多层记忆库(短期会话内存、中期检索记忆、长期持久记忆);
- 事件驱动循环:基于异步 I/O 事件循环持续监听外部触发(用户消息、定时 Cron 任务、外部 Webhook 回调),90% 时间处于 I/O 等待空闲状态,仅收到事件时触发 LLM 推理与工具调用;
- 记忆分层读写:内存缓存高频对话上下文,本地文件持久化 MEMORY.md 长期记忆,内置 FTS5 本地检索引擎,频繁读写沙箱本地文件系统;
- 故障敏感点:主进程崩溃会丢失所有并行子 Agent 未完成任务,无原生断点快照机制;协程并发无内置资源限制,多子 Agent 并行会瞬间拉高 CPU、磁盘 IO。
底层适配技术需求:沙箱支持异步协程资源限额、多层状态快照、并行任务 Checkpoint 持久化、Cron 定时任务常驻监听。
3.2 OpenClaw 运行时底层特征
OpenClaw 是多 IM 渠道接入的自动化执行 Agent,主打 Telegram/Discord/Slack 等消息通道联动,底层运行特征:
- 多通道长连接常驻:启动后建立多条 WebSocket 长连接绑定消息平台,长连接一旦断开会丢失会话订阅,需要持续保活网络链路;
- 线性单执行循环:无并行子 Agent,单一线性任务执行链路,支持 Shell 批量命令、文件批量读写、网页自动化爬取,IO 密集型负载占比高;
- 文件即记忆架构:全部持久状态以 Markdown 文件存储在沙箱本地目录,单会话产生大量日志文件,频繁小文件读写;
- 租户隔离风险点:原生支持无限制 Shell 执行、文件系统遍历,若共享运行环境极易发生跨租户文件读取逃逸。
底层适配技术需求:沙箱网络长连接保活、细粒度 Shell 命令白名单、文件系统读写配额、小文件分层存储优化。
3.3 ClaudeCode 运行时底层特征
ClaudeCode 面向代码开发场景的 Repo 中心型智能体,深度绑定代码仓库环境,底层运行特征:
- 代码仓库上下文常驻加载:启动时拉取完整代码仓库目录树、Diff 记录、CLAUDE.md 规则文件,常驻内存维护仓库索引,单次启动 IO 开销极大;
- 长时代码执行链路:单轮任务可能持续数十分钟,执行单元测试、构建打包、代码重构,存在超长阻塞执行流程;
- 上下文窗口超大:原生支持 200K Token 超长上下文,内存占用远高于 Hermes、OpenClaw,内存资源开销是三类框架最高;
- 状态依赖本地代码目录:所有任务进度、代码修改缓存、测试记录存储在本地 Repo 目录,实例迁移必须完整同步代码文件快照。
底层适配技术需求:沙箱内存弹性配额、大文件镜像分层按需加载、超大增量快照同步、长任务断点存储引擎。
3.4 三类框架统一底层共性(平台核心优化方向)
- 全部为有状态长驻进程,区别于单次执行的无状态 API 服务,生命周期以天、月为单位;
- 高度依赖本地沙箱文件系统存储持久记忆、任务进度、业务上下文;
- 空闲时间占比极高,存在大量 I/O 等待、定时休眠窗口;
- 存在自定义工具调用、系统命令执行能力,安全隔离为底层核心约束;
- 无原生分布式集群调度、实例休眠、跨节点迁移、自动自愈能力,必须由托管平台提供底层底座支撑。
4 Agent 37 Cloud 整体五层云原生架构总览
Agent 37 Cloud 整体采用分层解耦云原生架构,五层自上而下完全解耦,层间通过标准化 gRPC 内部协议通信,无强耦合依赖,可独立扩容、迭代、故障隔离,五层完整架构如下:
- 接入网关层(API Gateway Plane):外部唯一流量入口,对外暴露标准化 REST/GraphQL API,实现单次 API 调用分配专属租户 Agent,负责鉴权、限流、请求路由、协议转换、流式消息转发;
- 控制平面层(Agent Control Plane):平台调度核心,分布式集群管控所有租户 Agent 生命周期,内置预热池调度、资源配额计算、租户事务管理器、自愈故障调度、跨节点迁移控制器;
- 运行时沙箱层(MicroVM Sandbox Plane):底层虚拟化执行底座,为每个租户创建独立轻量 MicroVM,承载 Hermes/OpenClaw/ClaudeCode 原始 Agent 进程,提供内核级隔离、进程保活、空闲冻结唤醒、资源硬限制;
- 状态持久化引擎层(Checkpoint Storage Plane):分层快照存储系统,管理所有 Agent 内存上下文、本地文件系统、任务执行断点,分为内存热层、高速块存储中频层、对象归档冷层,实现毫秒级断点续跑;
- 框架适配与可观测层(Adapt & Observability Plane):横向支撑模块,包含三类 Agent 标准化适配适配器、全链路指标采集、日志聚合、崩溃快照抓取、自动化运维自愈规则引擎。

五层架构核心解耦优势:
- 接入网关横向无限扩容,支撑百万级租户 API 并发创建请求;
- 控制平面无状态分布式集群,节点故障不影响在线 Agent 实例;
- 沙箱层算力集群与调度平面分离,可独立扩充 CPU / 内存算力节点;
- 存储分层独立扩容,根据租户活跃冷热数据弹性调整存储资源;
- 适配层独立迭代,新增 Agent 框架无需修改底层虚拟化、调度核心代码。
5 接入网关层:单 API 租户 Agent 分配协议与流量调度技术
接入网关是开发者唯一交互入口,平台核心技术承诺 "仅需一次 API 调用,即可为每位客户分配一个始终在线的专属智能体",全部底层逻辑由网关层 + 控制平面协同完成,本节拆解网关底层实现细节。
5.1 网关底层技术栈选型与架构
网关采用 Rust 高性能异步网关框架开发,摒弃 Nginx+Lua 传统网关架构,原生支持 HTTP1.1/HTTP2/WebSocket/SSE 流式协议,适配三类 Agent 的长连接、流式输出需求:
- 底层网络:基于 Tokio 异步 Runtime,epoll IO 多路复用,单机网关支撑 10 万并发长连接;
- 鉴权模块:内置租户密钥、API Key、RBAC 权限校验,无第三方鉴权中间件依赖;
- 协议转换:对外提供标准化 REST API,对内通过 gRPC 流式请求下发至控制平面集群;
- 流量隔离:租户请求独立连接池,单租户限流隔离,防止批量创建请求挤占全局调度资源;
- 事务协调器:API 创建 Agent 全链路分布式事务保障,创建失败自动回滚沙箱、存储、网络资源,无孤儿实例残留。
5.2 核心原子 API:CreateDedicatedAgent 底层执行链路
单次 API 创建专属 Agent 是平台最核心原子操作,完整底层执行链路分为 7 个阶段,全部由网关透明封装,开发者仅传入租户 ID、框架类型(Hermes/OpenClaw/ClaudeCode)、基础资源配额、初始化环境变量四类参数,无需感知底层集群逻辑:
阶段 1:网关接收 HTTP POST 请求,校验 API Key 租户权限、参数合法性、并发限流阈值,非法请求直接返回 4xx,不进入调度链路;
阶段 2:网关组装标准化 gRPC CreateAgentRequest 结构体,携带租户唯一标识、框架镜像标识、资源限额、初始化 Checkpoint 快照 ID、网络白名单策略,下发至控制平面负载均衡节点;
阶段 3:控制平面接收请求,开启分布式事务,查询预热空闲沙箱池,优先复用预初始化 MicroVM 实例,无空闲池时触发新沙箱创建调度;
阶段 4:调度节点下发创建指令至算力节点沙箱管理器,完成 MicroVM 初始化、框架 Runtime 镜像分层加载、网络独立 IP 绑定、租户文件系统初始化;
阶段 5:存储引擎同步初始化快照(空基线快照或租户自定义初始化模板快照),挂载三层存储分层目录至沙箱本地文件系统;
阶段 6:沙箱启动对应框架守护进程,执行原生 Agent 启动脚本,内置健康探测循环,连续 3 次就绪探针通过标记实例为 "始终在线可用";
阶段 7:网关接收控制平面成功回调,封装租户专属 Agent 独立访问 Endpoint(独立域名 / WS 地址 / API 密钥),完整返回至开发者,全链路正常耗时控制在 1.5s~3s,复用预热池实例可压缩至 300ms 内。
5.3 网关流量转发与长驻 Agent 通信适配
专属 Agent 创建完成后,所有租户业务流量(消息推送、工具调用回调、代码执行流式输出、定时任务触发)全部经网关路由至对应隔离沙箱,底层路由核心技术:
- 租户会话亲和路由:基于租户唯一 ID 做一致性哈希,所有请求永久路由至同一 MicroVM 沙箱,不会出现请求跨实例分发导致上下文丢失,适配 Agent 有状态运行特性;
- SSE/WS 流式优化:针对 OpenClaw 多渠道消息流、ClaudeCode 代码执行实时日志、Hermes 子 Agent 并行输出,网关内置流式分片缓存,降低大流量下沙箱进程 IO 阻塞;
- 网络隔离网关转发:每个租户沙箱分配独立内网 IP,网关通过租户网络策略隔离跨沙箱直接通信,仅允许通过网关做受控 API 交互,底层关闭沙箱之间内网互通路由;
- 请求超时分层处理:区分普通对话短请求、代码长执行长请求两套超时阈值,ClaudeCode 代码任务最长支持 30 分钟请求保活,适配超长执行链路。
5.4 网关层高可用底层保障
- 网关集群无状态,多可用区多节点部署,请求负载均衡分发,单网关节点宕机自动切换剩余节点,在线租户长连接自动重连无丢失;
- API 创建请求幂等设计,携带唯一幂等 ID,重复调用不会重复创建多套沙箱实例,避免资源冗余;
- 全局请求日志持久化至对象存储,完整记录每一次创建 Agent API 入参、调度耗时、失败原因,底层可追溯批量租户交付全链路日志。
6 控制平面层:Agent 全生命周期调度、预热池与资源配额算法
控制平面是平台分布式调度核心,全部采用 Go 开发无状态微服务集群,横向扩容无上限,负责所有租户 Agent 实例的生命周期管控、算力节点调度、资源量化计算、故障自愈、跨节点迁移,是替代人工运维服务器的核心底层模块。
6.1 Agent 完整生命周期状态机底层定义
控制平面内置标准化有限状态机,覆盖持久 Agent 全生命周期,所有状态变更落地至分布式 etcd 元数据存储,保证集群节点状态一致性,核心状态枚举:
INIT_PREHEAT:预热池预创建冻结实例,未绑定租户,内存冻结,算力释放;ALLOCATING:API 触发租户分配,预热实例唤醒 / 新创建沙箱,挂载租户存储快照;RUNNING_ONLINE:正常 7×24 小时在线运行,进程活跃,持续监听事件、维护上下文;IDLE_SUSPEND:连续阈值时间无交互、无定时任务,触发内存冻结,CPU 算力回收,仅保留持久化磁盘快照;WAKE_RESUME:收到租户新请求、定时任务触发,从冻结快照秒级唤醒,恢复内存上下文;FAULT_DETECT:进程崩溃、资源溢出、网络断开,故障探测模块标记故障状态;MIGRATING:算力节点负载过高 / 硬件故障,自动跨节点迁移沙箱快照;TERMINATE_ARCHIVE:租户释放实例,沙箱销毁,完整状态快照归档至冷存储,资源回收。
状态机底层规则:RUNNING_ONLINE为对外承诺 "始终在线" 状态,平台控制平面持续保障该状态,故障自动触发迁移 / 重启,不会主动销毁租户专属实例,仅开发者主动调用销毁 API 才会进入归档状态。
6.2 Warm Pool 预热池调度核心算法(解决冷启动痛点)
自建 VPS/K8s 最大缺陷为新租户实例创建冷启动缓慢,Agent 37 Cloud 控制平面自研分层预热池调度算法,底层逻辑拆解:
- 三级预热池划分:按 Hermes、OpenClaw、ClaudeCode 三类框架划分独立预热池,每类池子维护固定数量预初始化 MicroVM 沙箱;
- 预初始化逻辑 :预热池沙箱提前完成镜像分层拉取、系统依赖安装、Runtime 环境初始化,进程启动后直接进入
INIT_PREHEAT冻结状态,释放 CPU,仅保留沙箱文件系统基线快照; - 动态扩缩池容量:控制平面实时统计近 5 分钟 CreateDedicatedAgent API 并发量,低并发收缩预热池最小容量,高并发自动扩容预热 MicroVM 数量;
- 租户分配优先复用:收到创建 API 请求时,优先从对应框架预热池取出冻结实例,执行唤醒、挂载租户快照、绑定独立网络,跳过镜像拉取、环境初始化耗时,分配耗时压缩至 300ms 内;
- 预热池实例轮换:冻结实例 72 小时自动轮换销毁重建,避免长期闲置带来系统缓存、依赖老化问题,保证环境一致性。
预热池底层量化收益:无预热池新建沙箱平均耗时 2.7s,复用预热池平均耗时 0.28s,批量交付垂直客户时并发创建吞吐量提升 8~10 倍。
6.3 租户资源配额量化调度底层实现
平台底层为每一个专属 Agent 硬隔离资源上限,基于三类框架内存、CPU 负载特征动态分配基础配额,底层采用 cgroups v2 内核级限制,无应用层软限制漏洞:
- 基础资源配额基线(平台默认最小规格,对应 3.44 美元月租底层算力标准,纯技术资源规格描述,不含定价营销解读):
- CPU:0.3 核硬上限,峰值短时弹性扩容至 0.6 核,空闲自动回落;
- 内存:256MiB 基线,ClaudeCode 框架自动上调至 512MiB,支持开发者自定义扩容至 1GiB;
- 磁盘:10GiB 分层持久化存储,区分热内存快照、中频会话文件、冷归档日志;
- IO 带宽:50MiB/s 磁盘读写硬限制,防止单租户批量文件操作挤占节点 IO;
- 网络:独立内网 IP,出站带宽 10Mbps 限流,细粒度域名访问白名单控制。
- 动态资源调度算法: 控制平面实时采集沙箱 CPU / 内存 / IO 指标,当 Agent 持续高负载超过阈值 15 分钟,自动临时上调弹性算力配额;连续 30 分钟空闲则触发
suspend冻结,回收全部弹性 CPU、多余内存,仅保留基线磁盘快照,平衡算力资源利用率与 Agent 在线连续性。 - 资源争抢规避机制: 算力节点调度时基于剩余可用资源做装箱算法,同一物理节点不会超额分配沙箱实例,预留 10% 硬件缓冲资源,杜绝多租户并发负载导致节点雪崩,底层放弃 K8s 默认贪心调度,采用 Agent 专用最小碎片装箱调度策略。
6.4 分布式自愈与跨节点迁移底层模块
控制平面内置 Agent 自愈控制器,完全替代人工服务器运维,底层两大核心自动化能力:
- 故障自愈闭环流程
步骤 1:沙箱层监控模块上报进程崩溃、内存 OOM、长连接断开、工具调用死锁四类故障指标;
步骤 2:控制平面故障判定引擎区分瞬时抖动故障 / 永久性沙箱故障;瞬时故障直接本地重启进程,从最近 Checkpoint 快照恢复;硬件永久性故障触发跨节点迁移;
步骤 3:自愈流程自动抓取崩溃全量快照、崩溃日志、执行堆栈,写入租户归档存储;
步骤 4:自动重新唤醒实例 / 迁移至空闲算力节点,恢复至RUNNING_ONLINE在线状态,全程无人工介入,故障恢复平均耗时小于 10s; - 跨节点增量迁移底层技术
自研 MicroVM 增量快照迁移协议,无需完整复制 10GiB 磁盘:
- 第一轮同步:基线文件系统全量快照(仅租户首次迁移执行);
- 第二轮持续增量同步:实时同步沙箱变更文件、内存增量快照;
- 切换断点:增量同步差值收敛至阈值后,冻结源沙箱,同步最后一轮内存状态,目标沙箱直接唤醒上线,切换中断时长低于 200ms;
- 迁移完成后源沙箱销毁,回收算力资源,租户业务无感知。
7 运行时沙箱层:轻量级 MicroVM 隔离、长驻进程保活底层实现
沙箱层是平台最底层执行底座,所有 Hermes/OpenClaw/ClaudeCode Agent 原始进程均运行在独立轻量 MicroVM 中,放弃传统 Docker 容器弱隔离方案,采用 Rust 自研轻量化 VMM 虚拟化引擎,实现租户内核级强隔离,本节拆解虚拟化底层核心技术。
7.1 MicroVM 轻量虚拟化选型底层逻辑
放弃标准 KVM 重型虚拟机、Docker 容器两种方案,自研轻量化 MicroVM,技术取舍底层依据:
- 容器(Docker/Nsenter)缺陷:共享宿主机内核,存在系统调用逃逸漏洞,OpenClaw 支持 Shell 命令执行场景下安全边界失效,无法满足多租户数据隔离底层要求;
- 标准 KVM 虚拟机缺陷:完整操作系统镜像体积大(数 GB),启动耗时数十秒,资源开销高,无法支撑预热池大批量预创建实例;
- 自研 MicroVM 优势:
- 裁剪定制迷你 Linux 内核,仅保留 Agent 运行必需系统调用,内核镜像体积 < 30MiB;
- 单 VM 内存开销极低,基线 256MiB 即可稳定运行三类框架,单物理节点可承载上百租户独立沙箱;
- 完整独立内核地址空间,租户进程无法访问宿主机、其他沙箱内存 / 文件 / 网络,无逃逸路径;
- 原生支持内存冻结、增量快照、秒级唤醒,专为长驻空闲 Agent 负载优化。
每个租户专属 Agent 严格绑定唯一 MicroVM,一对一绑定关系,不存在多租户共享沙箱的底层设计,从硬件虚拟化层面保证 "专属智能体" 的隔离定义。
7.2 沙箱三层隔离底层实现(计算 / 存储 / 网络)
- 计算隔离(内核级) 每个 MicroVM 拥有独立内核、独立 CPU 调度上下文、独立内存地址空间,cgroups v2 硬限制 CPU、内存、IO 资源,宿主机无法读取 VM 内部内存数据,VM 内进程无法探测宿主机硬件信息、其他 VM 进程 PID;所有系统调用经过 VMM 过滤,禁用危险系统调用(原始 socket 绑定、硬件访问、mount 挂载、内核模块加载),OpenClaw Shell 命令增加白名单过滤层,仅允许预定义安全工具指令执行。
- 存储隔离(文件系统独立挂载) 每个 VM 挂载独立三层分层存储卷,与其他租户文件系统完全隔离,无共享读写目录;沙箱内部用户为非 root 低权限账号,禁止修改系统核心目录,Agent 业务文件仅能读写挂载的租户专属持久卷;快照生成、同步、归档均在 VMM 底层拦截文件系统操作,租户进程无法篡改快照底层数据。
- 网络隔离(独立网络栈) 每台 MicroVM 分配独立虚拟网卡、独立内网 IP、独立路由表,沙箱之间默认无路由互通,仅能通过上层网关层受控转发外部请求;出站网络域名白名单由控制平面下发至 VMM 网络过滤器,禁止访问内网元数据服务、其他租户内网地址,杜绝横向渗透风险;多 IM 渠道 WebSocket 长连接在独立网络栈维护,单个租户连接断开不会影响其他沙箱网络链路。
7.3 长驻 Agent 进程保活与空闲冻结唤醒底层机制
针对三类 Agent 长期在线、大量空闲等待的负载特征,沙箱 VMM 内置原生suspend/resume冻结唤醒引擎,区别于应用层进程休眠,属于内核内存级冻结,底层流程:
- 空闲判定触发冻结 VMM 实时采集 VM 内部 Agent 进程活跃指标:无用户消息、无定时 Cron 任务、无工具调用执行、LLM 推理进程空闲持续 15 分钟,触发冻结流程;
- 内存快照冻结流程 步骤 1:暂停 VM 内所有用户态进程,拦截所有文件写入系统调用,完成增量内存快照写入中频块存储; 步骤 2:回收 VM 分配的弹性 CPU 核心、多余内存页,仅保留最小内存缓冲区用于存储快照索引; 步骤 3:VM 网络栈轻量休眠,仅保留心跳探测长连接,持续接收网关层唤醒信号; 步骤 4:沙箱状态同步至控制平面,标记为
IDLE_SUSPEND,算力资源释放,降低底层硬件占用; - 秒级唤醒恢复流程 当网关收到租户新业务请求、内置 Cron 定时任务触发、外部 Webhook 回调到达时,下发唤醒指令至 VMM: 步骤 1:分配预预留 CPU、内存资源,加载最近增量内存快照至 VM 地址空间; 步骤 2:恢复文件系统写入权限,重启所有 Agent 守护进程、子协程、IM 长连接; 步骤 3:执行健康探测,校验 Hermes 并行引擎、OpenClaw 通道连接、ClaudeCode 仓库索引完整性; 步骤 4:状态切换为
RUNNING_ONLINE,完整恢复冻结前全部内存上下文、会话记忆、未完成任务,唤醒耗时平均 < 150ms,无上下文丢失。
该机制底层解决自建 VPS/Mac mini 空闲资源持续占用的核心痛点,在保证 Agent 始终在线的前提下大幅降低算力资源开销。
7.4 框架 Runtime 镜像分层加载底层优化
Hermes、OpenClaw、ClaudeCode 依赖环境体积较大,平台采用镜像分层按需加载技术,降低预热池存储开销与沙箱启动 IO 延迟:
- 基础内核层:迷你 Linux 内核(30MiB),所有 VM 共享只读分层;
- Runtime 公共层:Node.js/Python、系统工具包、基础 LLM 客户端 SDK,同框架所有预热池实例共享只读分层;
- 租户私有层:租户业务代码、自定义 Prompt、CLAUDE.md、私有 API 密钥、会话记忆文件,独立可读写分层;
- 按需懒加载:ClaudeCode 代码仓库大文件仅在首次代码任务执行时拉取,预热阶段不加载完整仓库目录,大幅降低预热池磁盘占用。
分层存储底层收益:单框架公共分层全局共享,百租户场景镜像存储体积降低 75%,沙箱初始化磁盘 IO 耗时降低 60%。
8 状态持久化引擎层:三层 Checkpoint 断点续跑架构
持久型 Agent 核心价值是状态连续性,自建方案最大缺陷为无标准化分层快照,Agent 37 Cloud 自研三层分级 Checkpoint 存储引擎,适配 Hermes 多层记忆、OpenClaw 海量小文件、ClaudeCode 超大代码仓库三种差异化存储负载,底层架构分为热内存层、中频块存储层、冷归档对象层。


8.1 三层存储分层设计与数据划分
- 第一层:热内存快照层(Redis Cluster 分布式内存) 存储内容:Agent 运行时内存上下文、当前对话窗口、并行子 Agent 临时状态、工具调用中间返回结果、活跃会话缓存; 读写特征:超高频毫秒级读写,每次用户交互自动增量写入; 生命周期:VM 冻结 / 唤醒核心数据源,故障本地重启优先读取内存快照,无需访问磁盘; 淘汰策略:租户实例释放 7 天后自动清除热内存数据,快照同步至中频层永久留存。
- 第二层:中频高速块存储层(分布式 NVMe 块存储) 存储内容:沙箱完整文件系统增量快照、MEMORY.md 长期记忆、代码仓库目录、每日会话日志、定时任务执行记录; 读写特征:中频持久写入,每 5 分钟自动增量快照,VM 冻结强制全量同步; 核心作用:跨节点迁移、沙箱重建、唤醒恢复的基准磁盘数据源,所有租户永久留存,仅主动销毁实例时归档至冷层。
- 第三层:冷归档对象存储层(兼容 S3 对象存储) 存储内容:租户全量历史归档快照、崩溃完整堆栈日志、过期会话批量日志、已释放实例完整备份; 读写特征:低频只读访问,仅故障溯源、历史数据导出时读取; 成本优化:采用压缩归档、冷存储低功耗介质,降低长期历史数据存储硬件开销。
8.2 增量 Checkpoint 快照底层生成逻辑
摒弃全量磁盘快照低效方案,采用写时复制(Copy-on-Write)增量快照机制:
- 基线快照:租户 Agent 首次分配时生成完整空基线文件系统快照,存入中频块存储;
- 增量变更追踪:VMM 文件系统拦截器实时记录沙箱内所有文件修改、新增、删除操作,维护变更差分日志;
- 定时增量快照:每 5 分钟基于差分日志生成轻量增量快照,仅存储变更数据块,体积远小于全量快照;
- 冻结强制快照:沙箱进入
suspend空闲冻结前,强制同步最新内存增量快照 + 文件系统差分快照,保证唤醒时数据一致性; - 故障断点快照:进程崩溃瞬间自动触发紧急快照,保存崩溃前完整执行状态,自愈重启从紧急快照续跑,任务进度无丢失。
8.3 三类框架差异化存储适配优化
- Hermes 适配优化:针对三层记忆架构,拆分短期会话存入热内存层、中期检索文件存入中频层、长期历史任务归档冷层;并行子 Agent 协程状态独立快照,崩溃后主 Agent 可恢复所有子任务进度;
- OpenClaw 适配优化:海量 Markdown 小文件采用块存储合并存储,减少小文件 IO 开销;多 IM 渠道会话日志按渠道分片存储,流式消息实时写入热内存快照保证长连接会话连续性;
- ClaudeCode 适配优化:超大代码仓库采用分块增量同步,仅同步修改代码 Diff,完整仓库基线快照缓存至算力节点本地磁盘,代码执行任务优先读取本地缓存,大幅降低块存储远程 IO 延迟;200K Token 超长上下文拆分分片存入分布式内存集群,避免单 Redis 分片内存溢出。
8.4 数据一致性底层保障
存储引擎内置分布式事务,快照生成、同步、归档全程原子操作:
- 快照写入过程中沙箱文件系统锁定,不会出现半写损坏快照;
- 跨三层存储快照 ID 全局唯一关联,唤醒、迁移时自动关联对应内存 + 磁盘快照组合;
- 元数据存储于 etcd 强一致集群,快照索引不会丢失,即使算力节点离线,租户完整状态仍永久保存在分布式存储集群。
9 框架适配适配层:Hermes/OpenClaw/ClaudeCode 标准化兼容适配器
平台底层设计核心兼容目标:无需修改 Hermes、OpenClaw、ClaudeCode 原始业务代码,直接托管运行,所有运行时适配逻辑由横向适配层标准化适配器完成,本节拆解适配器底层实现原理。
9.1 统一抽象适配接口定义
适配层定义统一 Agent Runtime 抽象接口,三类框架适配器实现同一套抽象方法,控制平面、沙箱层无需感知底层框架差异,标准化抽象核心方法:
// 伪代码:统一Agent适配抽象接口
type AgentAdapter interface {
// 初始化框架运行环境,加载租户快照
InitRuntime(sandboxCtx SandboxContext) error
// 启动Agent守护主进程
StartDaemon() error
// 抓取当前全量运行状态,生成Checkpoint
CaptureCheckpoint() (CheckpointData, error)
// 从快照恢复运行状态
ResumeFromCheckpoint(cp CheckpointData) error
// 检测进程健康状态,返回就绪/故障标记
HealthProbe() AgentHealthStatus
// 停止进程,安全生成最终快照
GracefulStop() CheckpointData
// 框架内置定时任务调度适配
SyncCronTasks()
}
控制平面仅调用统一抽象接口,新增其他 Agent 框架仅需开发对应适配器,底层调度、虚拟化、存储模块零改动,架构扩展性极强。
9.2 三类框架专属适配器底层实现
- HermesAdapter(Hermes 专用适配)
-
适配点 1:拦截 Hermes 多层记忆读写调用,自动同步至三层存储引擎,替换本地单文件存储逻辑;
-
适配点 2:监听并行子 Agent 协程创建 / 销毁事件,独立记录子任务 Checkpoint,崩溃可单独恢复子 Agent;
-
适配点 3:封装 Hermes 原生 Cron 定时调度,同步至沙箱层心跳监听,冻结后定时任务可唤醒实例执行;
-
适配点 4:限制并行子 Agent 并发数量,匹配租户 CPU 资源配额,防止协程无限创建耗尽算力。
- OpenClawAdapter(OpenClaw 专用适配)
-
适配点 1:接管多 IM 渠道 WebSocket 长连接生命周期,沙箱冻结时轻量保活连接,唤醒自动重连会话;
-
适配点 2:拦截 Shell 系统调用,对接沙箱 VMM 命令白名单过滤器,危险指令直接拦截返回;
-
适配点 3:优化 MEMORY.md 海量小文件写入,批量合并提交至中频块存储,降低频繁 IO 损耗;
-
适配点 4:统一多渠道消息流式输出协议,转换为网关标准 SSE 流对外分发。
- ClaudeCodeAdapter(ClaudeCode 专用适配)
-
适配点 1:拦截代码仓库文件读写、Diff 记录操作,生成分块增量快照,优化大仓库同步性能;
-
适配点 2:监控超长代码执行任务进度,每 30 秒自动写入断点快照,数十分钟长任务崩溃可精准续跑;
-
适配点 3:动态调整沙箱内存配额,检测代码加载时自动上调内存上限,空闲回落基线;
-
适配点 4:标准化 CLAUDE.md 规则文件持久化,分层存入中频存储,实例迁移完整同步规则配置。
9.3 无代码适配底层兼容原理
适配器以 Sidecar 轻量进程形式运行在每个 MicroVM 内部,与 Agent 原始进程同沙箱、独立 PID 命名空间,通过三种无侵入方式适配框架:
- 文件系统劫持:VMM 层拦截框架本地文件读写,透明转发至三层存储引擎,框架代码无感知;
- 进程信号监听:捕获 Agent 进程 SIGUSR、SIGTERM 信号,触发自动快照、优雅停止逻辑;
- 网络流量劫持:Sidecar 代理框架对外 LLM API、IM 渠道网络请求,统一添加租户鉴权、限流、日志采集逻辑; 全程无需修改 Hermes/OpenClaw/ClaudeCode 源码、无需重新编译框架二进制,开发者直接上传原有 Agent 业务代码即可托管,实现零改造迁移。
10 可观测与自愈运维底层模块:无人工运维自动化技术实现
自建 VPS/Mac mini 最大人工成本来源于服务器运维、故障排查、监控巡检,Agent 37 Cloud 横向可观测与自愈模块内置全自动化运维能力,底层完全屏蔽服务器操作,开发者无需介入任何基础设施运维工作。
10.1 全链路指标采集底层架构
- 三级指标采集源:
-
虚拟化层指标:MicroVM CPU / 内存 / 磁盘 IO / 网络带宽、快照生成耗时、冻结唤醒延迟;
-
Agent 运行时指标:框架进程 CPU 占用、上下文 Token 总量、工具调用次数、长连接在线数、任务执行时长;
-
平台调度指标:预热池实例数量、API 创建并发量、跨节点迁移次数、故障自愈成功率;
- 采集底层技术:VMM 内置 eBPF 探针采集虚拟化指标,Sidecar 适配器采集框架业务指标,gRPC 流式上报至时序数据库集群;指标采集粒度 10 秒,永久存储 90 天历史数据,支持租户维度单独指标大盘导出。
10.2 分布式日志聚合底层实现
每个沙箱 Sidecar 实时采集三类日志,统一结构化归档至冷对象存储:
- 平台底层日志:沙箱创建、冻结、唤醒、迁移、自愈操作日志;
- 框架运行日志:Hermes 子 Agent 输出、OpenClaw 消息通道日志、ClaudeCode 代码执行终端日志;
- 故障堆栈日志:进程崩溃 OOM、LLM 调用超时、Shell 命令报错完整堆栈; 日志按租户 ID、框架类型、时间分片索引,支持开发者按客户维度检索专属 Agent 全量日志,底层无需登录服务器查看本地日志文件。
10.3 自动化自愈规则引擎(无人运维核心)
规则引擎预定义 28 类持久 Agent 专属故障自愈规则,全部自动执行,无需人工触发,核心规则分类:
- 进程类故障规则:Agent 主进程意外退出、OOM 内存溢出、死锁阻塞,本地重启 + 读取最近快照恢复;
- 网络类故障规则:IM 渠道 WebSocket 断开、LLM 接口持续超时,自动重连网络、切换模型备用端点;
- 资源类故障规则:持续 CPU 打满、磁盘占用超限,弹性扩容资源配额 / 清理过期日志快照;
- 硬件节点故障规则:算力节点离线、磁盘损坏,自动触发租户沙箱跨节点增量迁移;
- 业务任务故障规则:长代码执行中断、并行子 Agent 崩溃,从任务断点快照续跑未完成链路。
所有自愈操作完整记录审计日志,故障恢复后自动推送结构化故障报告至开发者 API 回调,底层完全消除人工服务器巡检、重启、迁移操作。
11 Agent 37 Cloud 与自建 VPS/Mac mini 底层技术量化对比
从隔离能力、启动性能、资源利用率、运维成本、状态可靠性五大纯技术维度,量化对比三类部署方案底层指标,无商业价格对比,仅工程技术数据:
11.1 隔离强度量化对比
| 技术指标 | Mac mini 本地部署 | 自建 VPS K8s 容器 | Agent 37 Cloud MicroVM 沙箱 |
|---|---|---|---|
| 隔离层级 | 操作系统全局共享 | Linux Namespace 容器级,内核共享 | 独立迷你内核,硬件虚拟化级隔离 |
| 跨租户逃逸风险 | 极高,文件完全共享 | 中,存在容器系统调用逃逸漏洞 | 无,独立内核无共享系统调用路径 |
| 资源限制精度 | 应用层软限制,可突破 | cgroups 软限制,进程可抢占资源 | 内核 v2 cgroups 硬限制,无法突破配额 |
| 文件系统隔离 | 全局磁盘共享目录 | 独立持久卷,宿主机可访问 | VM 私有文件系统,宿主机不可读取数据 |
| 网络隔离 | 全局公网端口共享 | 集群内网互通,可横向访问 | 独立虚拟网卡,沙箱间无默认路由互通 |
11.2 实例分配与启动性能量化(单租户 Agent 创建平均耗时)
| 场景 | Mac mini 人工部署 | 自建 K8s 无预热池 | Agent 37 Cloud 复用预热池 | Agent 37 Cloud 新建沙箱 |
|---|---|---|---|---|
| 新租户初始化完整链路 | 8~15 分钟(人工配置环境、反向代理、进程保活) | 45~120 秒(拉取镜像、创建 StatefulSet、挂载存储) | 0.25~0.4 秒 | 1.2~3 秒 |
| 实例故障重启恢复耗时 | 30 秒~5 分钟(人工登录重启 / PM2 等待) | 15~40 秒(Pod 重建、重新拉取镜像) | 8~15 秒(本地快照唤醒重启) | 10~25 秒(跨节点迁移恢复) |
| 空闲冻结唤醒耗时 | 无冻结机制,始终满载占用算力 | 无冻结机制,Pod 持续占用资源 | 100~180ms 内存快照唤醒 | 无对应机制 |
11.3 硬件资源利用率量化(垂直行业 Agent 负载模型,日均活跃 10%)
| 部署方案 | 空闲算力回收能力 | 内存闲置浪费 | CPU 闲置浪费 | 磁盘存储冗余 | | ---- | ---- | ---- | ---- | |Mac mini 本地部署 | 无,硬件持续满载占用 | 90% 内存长期空闲 | 90% CPU 持续占用 | 全量磁盘永久挂载,无分层归档 | | 自建 VPS K8s 容器 | 无,Pod 常驻不释放资源 | 80% 内存闲置不回收 | 85% CPU 空闲占用计费 | 统一块存储,冷热数据无分层优化 | |Agent 37 Cloud 沙箱 | 空闲自动冻结,释放全部弹性算力 | 冻结后仅保留快照索引内存 | 空闲 CPU 完全回收至算力池 | 三层分级存储,冷数据低成本归档,热数据高速读写 |
11.4 状态持久化可靠性量化
| 技术指标 | Mac mini 本地磁盘 | 自建 VPS 云硬盘 StatefulSet | Agent 37 Cloud 三层 Checkpoint 引擎 |
|---|---|---|---|
| 断点续跑粒度 | 仅手动全量备份,无增量快照 | 定时全量快照,粒度粗,恢复丢失中间任务 | 5 分钟增量快照 + 崩溃紧急快照,单步骤任务可续跑 |
| 故障数据丢失概率 | 硬件断电 100% 丢失未备份状态 | Pod 销毁 / 磁盘故障丢失未同步快照 | 三层多副本快照,单存储层故障不丢失状态 |
| 跨实例迁移完整性 | 无法迁移,整机数据绑定硬件 | 迁移需完整复制磁盘,耗时久,易丢失上下文 | 增量差分迁移,内存 + 文件完整同步,业务无感知切换 |
| 长期记忆存储成本 | 本地硬件磁盘扩容成本高 | 统一高速块存储存储全量冷日志,成本高 | 冷数据归档至低成本对象存储,分层控存储开销 |
11.5 底层运维人力技术成本(工程研发视角)
| 运维工作项 | Mac mini 部署 | 自建 VPS K8s 集群 | Agent 37 Cloud 托管平台 |
|---|---|---|---|
| 集群调度控制平面开发 | 0(无集群,纯人工) | 需自研生命周期、自愈、迁移模块,3~6 人月研发量 | 平台内置完整控制平面,零自研开发 |
| 租户 API 网关开发 | 手动 Nginx 配置,无标准化接口 | 自研 Agent 专用网关、分布式事务 | 内置标准化 CreateDedicatedAgent 原子 API,开箱即用 |
| 监控指标、日志系统搭建 | 人工登录设备查看,无聚合大盘 | 搭建 Prometheus+ELK,自定义 Agent 探针 | 内置全链路指标、日志检索,租户独立大盘 |
| 故障自愈自动化逻辑 | 完全人工处理故障、重启、迁移 | 开发自愈控制器、快照同步流程 | 预定义 28 类故障自动自愈规则,零人工介入 |
| 多框架环境隔离适配 | 手动清理全局依赖,冲突频繁 | 自定义多镜像、Sidecar 适配层开发 | 标准化适配器,无代码兼容 Hermes/OpenClaw/ClaudeCode |
12 平台安全底层隔离体系:租户数据、网络、进程三级隔离
Agent 具备文件读写、Shell 执行、网络请求能力,多租户托管场景下底层安全隔离为核心技术底线,平台从进程虚拟化、存储数据、网络访问、密钥凭证四大维度构建完整安全底层体系。
12.1 虚拟化进程安全隔离
- 微型内核裁剪:移除所有内核模块加载、硬件访问、ptrace 跨进程调试系统调用,租户 Agent 进程无法读取其他沙箱内存、进程堆栈;
- 非 root 运行约束:所有沙箱内 Agent 进程使用低权限普通用户,禁止 sudo、root 权限操作,无法修改沙箱系统核心文件;
- Shell 指令白名单过滤:OpenClaw、Hermes 工具调用执行 Shell 前经过 VMM 白名单校验,删除文件批量销毁、内网扫描、端口监听等高危指令直接拦截,返回权限拒绝;
- 进程资源防溢出:CPU、内存、IO 硬限额,杜绝单租户进程耗尽节点硬件资源引发 DoS,影响其他客户 Agent。
12.2 租户数据存储安全隔离
- 存储多租户数据隔离:三层存储引擎底层数据分片按租户 ID 哈希拆分,不同租户快照物理存储分片隔离,无跨租户数据读取通道;
- 快照静态加密:所有内存、磁盘增量快照落地存储前自动 AES-256 加密,密钥由租户独立 API Key 派生,平台底层运维人员无解密权限;
- 凭证隔离存储:租户 LLM API 密钥、IM 渠道 Token、业务数据库凭证不存入沙箱本地文件,统一存入平台密钥管理服务,沙箱通过 Sidecar 临时按需拉取内存使用,磁盘无明文密钥持久化;
- 数据销毁机制:租户主动释放实例后,沙箱磁盘数据即时擦除,多层快照按归档策略 7 天后彻底删除,无残留可恢复数据。
12.3 网络访问底层安全管控
- 沙箱内网隔离:所有 MicroVM 独立虚拟网卡,沙箱之间无默认内网路由,禁止租户 Agent 直接互相访问;跨租户交互仅能通过上层网关层受控 API 鉴权转发;
- 出站域名白名单:控制平面为每个租户下发独立网络访问策略,仅允许业务必需 LLM 接口、IM 消息域名访问,拦截内网元数据服务、云厂商内部地址、恶意扫描域名;
- 流量加密全链路:网关与沙箱之间 gRPC 流量 TLS 加密,Agent 对外 LLM、IM 网络请求强制 HTTPS/WSS 加密,明文 HTTP 请求底层拦截;
- 独立租户网络 Endpoint:每个专属 Agent 分配唯一独立访问域名、独立 API 鉴权密钥,请求路由绑定租户 ID,无法通过伪造 Endpoint 访问其他租户沙箱。
12.4 API 接入层安全底层机制
- 租户 API Key 分级权限:CreateDedicatedAgent、销毁实例、读取快照日志区分读写权限,只读密钥无法发起实例创建、迁移操作;
- 请求限流防批量攻击:单租户 API 创建请求按时间窗口限流,防止恶意并发创建大量沙箱耗尽集群算力;
- 请求参数校验沙箱注入防护:网关层过滤 Shell 注入、路径遍历、快照 ID 伪造等恶意参数,拦截后不进入调度链路;
- 操作审计全留存:所有创建、销毁、迁移、快照读取 API 操作永久留存审计日志,记录调用方、时间、参数、操作结果,满足安全追溯底层要求。
13 生产级性能调优底层实践:冷启动、空闲休眠、并发优化
基于大规模垂直客户批量托管落地实践,整理平台底层三大核心性能瓶颈调优技术方案,全部为内核、调度、存储底层改造手段。
13.1 预热池冷启动调优
- 预热池容量动态自适应算法优化:基于过去 1 小时创建 API 吞吐量,采用指数平滑预测租户创建峰值,提前扩容预热 MicroVM,避免高峰期无空闲实例导致冷启动;
- 镜像分层本地缓存:算力节点本地磁盘缓存框架 Runtime 公共分层镜像,无需每次从远程镜像仓库拉取,预热池初始化 IO 延迟降低 70%;
- 预热实例后台预初始化:空闲算力节点低负载时段后台批量创建冻结预热 VM,避开业务高峰 IO 峰值,不占用租户运行时硬件资源。
13.2 空闲冻结唤醒链路调优
- 内存快照差分压缩:采用 LZ4 增量内存快照压缩算法,冻结快照体积降低 65%,存储写入、唤醒读取带宽开销大幅下降;
- 异步快照写入:Agent 进程业务逻辑与快照持久化异步分离,快照写入磁盘不阻塞用户消息处理、工具调用推理流程;
- 唤醒预加载缓存:网关收到唤醒请求时,并行下发内存快照预加载指令,沙箱 VMM 提前读取中频存储快照,同步恢复网络长连接,消除串行等待延迟。
13.3 批量租户并发创建调优
垂直领域创始人批量交付数十、上百客户专属 Agent 时,并发创建 API 易触发调度瓶颈,底层优化方案:
- 创建请求分布式队列削峰:网关层批量请求写入分布式消息队列,控制平面调度节点异步消费,避免瞬时并发压垮调度集群;
- 算力节点装箱分批分配:批量创建请求打散至不同算力节点,避免单节点一次性分配大量沙箱引发 IO 洪峰;
- 批量快照模板复用:同一垂直行业租户共享同一初始化基线快照,无需每个租户独立初始化空白环境,批量创建 IO 开销降低 80%。
14 垂直领域多租户批量交付底层工程方案
平台底层原生支撑创始人批量交付垂直领域专用智能体,完全依托单次 API 原子创建能力,底层批量交付完整工程链路拆解:
- 统一垂直框架模板打包:开发者将行业专属 Hermes/OpenClaw/ClaudeCode 业务代码、自定义 Prompt、工具集打包为标准化镜像模板,上传至平台镜像仓库,生成唯一模板 ID;
- 批量租户元数据批量导入:通过批量 API 上传客户租户 ID、资源配额、独立 API 密钥、行业初始化参数、网络访问白名单策略;
- 批量异步创建 API 调用:循环调用 CreateDedicatedAgent 接口,传入统一行业模板 ID 与独立租户参数,网关分布式队列异步处理批量请求;
- 控制平面批量调度优化:自动分配预热池空闲实例,打散至多算力节点,批量完成沙箱初始化、快照挂载、网络绑定;
- 批量交付 Endpoint 批量导出:所有租户专属 Agent 独立访问域名、WS 地址、鉴权密钥统一结构化返回,开发者直接交付自有客户;
- 全自动化运维兜底:批量创建完成后,平台自愈引擎 7×24 小时管控所有客户 Agent,进程崩溃、节点故障自动迁移恢复,无需人工维护每一个客户沙箱。
整套批量交付底层链路无任何人工服务器操作,完全屏蔽虚拟化、集群调度、存储复杂逻辑,核心底层支撑来自接入网关原子化创建 API、分布式控制平面、预热池调度三大核心技术。
15 当前架构技术局限与下一代演进技术路线
15.1 当前 Agent 37 Cloud 底层架构现存技术局限
- 仅支持 Hermes、OpenClaw、ClaudeCode 三类固定持久 Agent 框架,新增开源 Agent 框架需要独立开发适配适配器,无通用 Agent 标准化抽象协议;
- MicroVM 轻量虚拟化自研 VMM 不支持 GPU 硬件直通,仅适配纯 CPU 推理 Agent 负载,无法承载本地大模型运行的 GPU 型智能体;
- 租户沙箱一对一独占 MicroVM,超轻量微型 Agent 场景资源利用率仍有优化空间,不支持多租户低隔离共享轻量运行时;
- 跨区域多活部署能力较弱,当前架构单集群集中式调度,异地算力节点租户沙箱迁移快照同步延迟偏高;
- 内置定时任务调度仅支持基础 Cron 规则,无分布式工作流编排底层引擎,复杂跨天多步骤行业自动化流程适配能力有限。
15.2 下一代底层技术演进路线(纯技术迭代方向)
- 通用 Agent 标准化适配协议:定义跨框架统一 A2A 持久智能体运行协议,新增 Agent 框架无需开发定制适配器,原生兼容标准化 Runtime;
- GPU 直通 MicroVM 虚拟化升级:改造自研 VMM 支持虚拟化 GPU 显存、算力分片,支持本地量化大模型 Agent 托管运行;
- 混合隔离调度架构:新增轻量共享沙箱模式,面向低负载微型 Agent 提供容器级弱隔离方案,兼顾资源利用率与租户强隔离两种场景;
- 分布式跨区域调度平面重构:多可用区、异地算力节点全局统一调度,增量快照跨区域异步同步,实现全球租户 Agent 就近分配、故障异地迁移;
- 内置分布式持久工作流引擎:集成 DAG 任务编排底层模块,原生支持跨天、跨沙箱多 Agent 协同工作流,强化垂直行业复杂自动化场景底层支撑;
- 快照分层计算卸载:将增量快照压缩、差分计算卸载至存储层分布式计算节点,降低算力节点 CPU 快照处理开销。
16 总结与技术落地思考
Agent 37 Cloud 的全部技术创新,本质是针对 Hermes、OpenClaw、ClaudeCode 三类持久型有状态智能体的负载特征,重构一套专用云原生托管底层底座,彻底解决 Mac mini 本地硬件、自建 VPS/K8s 集群两类私有化部署的底层架构缺陷。
从底层技术拆解来看,平台五大核心技术体系构成完整闭环:原子化 API 接入网关屏蔽集群复杂逻辑、分布式 Agent 控制平面实现全生命周期无人调度、自研 MicroVM 沙箱提供内核级租户强隔离、三层分级 Checkpoint 存储引擎保障长驻 Agent 状态断点续跑、标准化框架适配器实现零代码兼容三类主流持久智能体。整套架构从虚拟化、调度、存储、网络、安全全链路针对长驻空闲、有状态、工具执行型 Agent 负载深度优化,在保证每个客户独占、始终在线专属智能体的底层能力前提下,大幅降低私有化部署所需的集群研发、服务器运维、资源调度、故障自愈工程成本。
对于垂直行业开发者与创始人,该平台底层技术价值不在于简化操作流程,而是将持久 Agent 部署中虚拟化隔离、分布式调度、分层快照、自动化自愈等高复杂度底层工程问题全部封装托管,研发资源可完全聚焦行业 Agent 业务逻辑迭代,无需投入人力维护底层服务器集群、自研调度与存储基础设施。同时,三层隔离安全体系、增量快照断点续跑、空闲冻结算力回收等底层技术,解决了自建方案无法平衡的安全、可靠性、资源利用率三大底层矛盾,为规模化批量交付行业专用智能体提供生产级底层支撑。
长远来看,持久型智能体托管基础设施会逐步从通用容器平台中独立分化,形成专门面向有状态长驻 Agent 的细分云原生技术赛道,Agent 37 Cloud 当前五层微沙箱架构、预热池调度、分层 Checkpoint 引擎的技术设计思路,可为同类持久 Agent 托管平台底层研发提供标准化工程参考。
文末互动
本文完整拆解 Agent 37 Cloud 全链路底层技术,无任何营销内容,聚焦虚拟化、调度、存储、多框架适配等工程底层实现。 如果文章对你自研 Agent 托管集群、优化 Hermes/OpenClaw/ClaudeCode 部署架构有技术参考价值,点赞支持作者持续输出底层架构干货;
收藏本文方便后续复盘沙箱隔离、Checkpoint 快照、预热池调度核心技术方案;
关注博主,持续更新 AI Agent 云原生托管、持久智能体底层架构、容器虚拟化性能调优系列深度技术文章,后续会同步发布下一代平台跨区域分布式调度架构拆解、MicroVM 轻量化虚拟化源码级解析两篇技术长文。