HACO:面向动态部署环境的对冲式智能计算可靠多智能体调度框架
论文原网页地址:https://arxiv.org/html/2607.19215v1
摘要
现有LLM多智能体系统大多假定执行环境固定不变,但真实云跨区域部署场景中,同一角色调用请求分配至不同智能实例时,会出现时延、失败率、输出质量显著差异:跨区光纤故障、机房高温宕机、区域算力拥堵都会破坏单一路由稳定性。本文提出HACO(Hedged Agent Computing)对冲式智能计算 运行时调度范式,将每一次角色调用建模为「角色类型+大模型+执行区域」三维约束下的候选集子集优化问题。
HACO核心为自适应对冲冗余分配+经验采集双机制:针对单次任务动态选取最小可靠对冲候选子集并行执行,而非固定单路由或全量并行;所有候选执行轨迹统一采集更新能力、网络时延、故障统计画像,持续优化后续调度策略。
在DSBench、InfiAgent-Bench、MatplotBench三套数据分析智能体基准,以及真实Azure跨区域云环境开展对照实验。对比单路由、固定区域、MoA全并行基线,HACO在网络/算力故障扰动场景下任务可靠性大幅提升,同时自适应控制token与时延开销,实现可靠性、推理成本、任务精度三者均衡权衡。
三大核心贡献
- 打破智能体固定环境假设,提出角色调用三维决策模型(角色/模型/执行区域),定位跨区部署带来的调度不稳定根源;
- 设计对冲冗余调度范式HACO,通过乐观候选排序+保守可靠性终止条件自适应选取并行子集,搭配全轨迹经验采集持续更新候选画像;
- 在仿真与真实Azure云环境完成大规模基准、消融、压力测试,验证框架可在可控算力开销下显著提升动态环境智能体执行鲁棒性。
1 引言
1.1 多智能体部署痛点
MetaGPT、ChatDev、Magentic-One等多智能体系统依靠角色分工完成复杂长时序任务,但现有框架调度逻辑默认执行区域、算力负载稳定。现实商用LLM云平台(Azure、AWS、GCP)支持多区域弹性部署,同一任务可调度至全球不同机房;跨海底光缆中断、机房热故障、区域API限流会造成部分实例高延迟/高失败率。
传统方案缺陷:
- 单一路由(BestOne/Random)固定选择最优候选,一旦该区域服务降级,任务失败率暴增;
- MoA、Best-of-N全量并行所有候选,可靠性高但token与时延成本翻倍;
- 简单故障降级仅串行重试,无法同步多条有效推理路径,容错能力弱。
现有LLM路由、级联降级方案仅聚焦单模型请求分发,未针对多角色、长时序智能体工作流设计自适应冗余调度机制。
1.2 HACO核心思路
- 三维角色抽象:每次调用绑定角色、基座模型、执行区域三类变量,全部候选实例构成候选池;
- 对冲冗余分配:不固定并行数量,基于Beta分布建模候选能力、网络故障概率,通过乐观分数排序筛选,保守可靠性阈值判定何时停止新增并行实例;
- 并行对冲执行:选中子集同步运行,仅等待最优可用候选返回,其余后台异步采集轨迹;
- 全量经验采集:每条执行记录更新模型推理能力、网络时延、丢包、故障统计画像,实现调度自迭代。
1.3 论文整体结构
第2章梳理多智能体、LLM路由、并行集成相关工作;第3章完整给出HACO四阶段执行范式、数学模型与算法伪代码;第4章仿真+真实Azure双环境大规模实验;第5章附录补充网络仿真、候选池配置、完整基线代码、消融数据表。
2 相关工作与理论基础
2.1 智能体运行容器(Agent harness)
Anthropic等工作提出完整智能体运行时封装层,统一管理上下文、工具、生命周期,但仅聚焦单实例执行逻辑,未解决多区域候选调度问题。HACO在容器上层增加跨区对冲调度层,二者互补。
2.2 LLM多智能体系统
MetaGPT、ChatDev以工作流划分角色;Magentic-One采用总控委派架构,全部系统假设执行环境静态,缺少动态区域故障应对调度层。
2.3 并行/冗余智能体方案
MoA(Mixture-of-Agents)全并行所有候选后打分择优,算力开销极大;AgentMapReduce面向搜索分支并行,无可靠性约束自适应冗余;LLM路由框架仅处理单条模型请求,不支持多角色长时序工作流的动态可靠性控制。
优化目标数学形式:
minS⊆A∑ai∈SCis.t.P(qualified success∣S)≥τ\min_{\mathcal{S}\subseteq\mathcal{A}}\sum_{a_{i}\in\mathcal{S}}C_{i}\quad \text{s.t.}\quad\mathbb{P}(\text{qualified success}\mid\mathcal{S})\geq\tauS⊆Aminai∈S∑Cis.t.P(qualified success∣S)≥τ
S\mathcal{S}S为对冲候选集,τ\tauτ为目标可靠度,CiC_iCi为候选执行成本,HACO求解带可靠性约束最小开销子集。
3 HACO对冲式智能计算完整范式
HACO分为四阶段流水线:角色抽象→冗余对冲分配→对冲并行执行→经验采集。

3.1 阶段1:角色抽象
智能体控制器输出角色调用事件:
et=(rt,xt)e_{t}=(r_{t},x_{t})et=(rt,xt)
rtr_trt:角色类型(规划/编码/调试/过滤);xtx_txt:任务上下文、历史输出、报错日志构成输入载荷。
同一载荷下发至筛选后的对冲候选子集,底层控制器可基于有限状态机/静态工作流实现,HACO与具体智能体编排引擎解耦。
3.2 阶段2:冗余对冲分配
输入:当前角色全部候选池;输出:满足可靠阈值最小并行子集。分为候选画像建模、双界协同调度两部分。
3.2.1 候选多维画像建模
- 推理能力Beta分布
θi\theta_iθi代表候选归一化输出质量,先验αi=βi=1\alpha_i=\beta_i=1αi=βi=1;每条执行后用得分qiq_iqi更新:
αi←αi+qi,βi←βi+(1−qi)\alpha_{i}\leftarrow\alpha_{i}+q_{i},\quad\beta_{i}\leftarrow\beta_{i}+(1-q_{i})αi←αi+qi,βi←βi+(1−qi)
后验均值μi=αiαi+βi\mu_i=\frac{\alpha_i}{\alpha_i+\beta_i}μi=αi+βiαi,标准差σi\sigma_iσi衡量能力不确定性。 - 物理执行成功率
ρi=(1−fint(i))(1−ℓnet(i))\rho_{i}=(1-f_{\mathrm{int}}^{(i)})(1-\ell_{\mathrm{net}}^{(i)})ρi=(1−fint(i))(1−ℓnet(i))
fintf_{int}fint内部推理失败率,ℓnet\ell_{net}ℓnet跨区网络丢包率,假设候选间故障独立。 - 时延感知成本
综合处理耗时、带宽抖动估算有效时延:
Ti=tproc(i)+kimax(ϵB,bi−κji)T_{i}=t_{\mathrm{proc}}^{(i)}+\frac{k_{i}}{\max(\epsilon_{\mathrm{B}},b_{i}-\kappa j_{i})}Ti=tproc(i)+max(ϵB,bi−κji)ki
基于韦伯费希纳定律归一化对数时延代价:
Ci=ln (1+TiT0),Di=1+ηCiC_{i}=\ln\!\left(1+\frac{T_{i}}{T_{0}}\right),\quad D_{i}=1+\eta C_{i}Ci=ln(1+T0Ti),Di=1+ηCi
DiD_iDi为时延惩罚折扣系数。
3.2.2 双界协同子集构造
- 乐观排序分数(用于候选择优)
Ui+=min(1,μi+λσi) ρiDiU_{i}^{+}=\frac{\min(1,\mu_{i}+\lambda\sigma_{i})\,\rho_{i}}{D_{i}}Ui+=Dimin(1,μi+λσi)ρi
λ\lambdaλ探索系数,鼓励观测少但潜力高的候选优先入池,按Ui+U_i^+Ui+降序排列候选。 - 保守可靠度(用于终止判断)
Ri−=min(0.98,max(ϵR,μi−γσi)⋅ρi)R_{i}^{-}=\min\left(0.98,\max(\epsilon_{\mathrm{R}},\mu_{i}-\gamma\sigma_{i})\cdot\rho_{i}\right)Ri−=min(0.98,max(ϵR,μi−γσi)⋅ρi)
使用保守下界计算累积失败概率:
Pfail←Pfail(1−Ri−)P_{\mathrm{fail}}\leftarrow P_{\mathrm{fail}}(1-R_{i}^{-})Pfail←Pfail(1−Ri−)
新增候选直至1−Pfail≥τ1-P_{\mathrm{fail}}\ge\tau1−Pfail≥τ或候选池耗尽,最终得到对冲子集S\mathcal{S}S。
3.3 阶段3:对冲并行执行
子集S\mathcal{S}S全部同步启动,等待任意执行成功的最高Ui+U_i^+Ui+候选返回即输出结果,其余候选后台异步采集轨迹。
awinner=argmaxai∈S+Ui+a_{\mathrm{winner}}=\arg\max_{a_{i}\in\mathcal{S}^{+}}U_{i}^{+}awinner=argai∈S+maxUi+
观测时延取最优候选完成时间与更高分候选最晚结束时间最大值,避免无效等待。若全部候选失败,向控制器抛出故障恢复信号。
3.4 阶段4:经验采集
所有执行候选的完整轨迹持久化更新两类全局画像:
- 候选能力画像 :使用LL裁判打分qiq_iqi更新Beta分布α,β\alpha,\betaα,β;同步更新历史平均时延、内部故障统计;
- 跨区网络画像 :更新链路带宽、抖动、丢包率,用于下一轮时延TiT_iTi估算。
冗余并行不只是单次容错手段,同时为后续调度提供海量环境样本,实现调度策略自优化。
HACO完整算法伪代码
python
def haco_schedule(role_event, candidate_pool, tau, lambda, gamma):
# 1. 加载全局候选/网络画像
load_global_profiles()
# 2. 遍历候选计算乐观排序分
cand_score = []
for cand in candidate_pool:
mu, sigma = get_beta_stats(cand)
rho = calc_success_rate(cand)
Ti = calc_latency(cand)
Di = 1 + eta * math.log(1 + Ti / T0)
Ui_plus = min(1, mu + lambda * sigma) * rho / Di
cand_score.append((-Ui_plus, cand))
# 按乐观分降序排序
cand_score.sort()
sorted_cands = [c for (s,c) in cand_score]
# 3. 增量构建对冲子集
hedge_set = []
Pfail = 1.0
for cand in sorted_cands:
mu, sigma = get_beta_stats(cand)
rho = calc_success_rate(cand)
Ri_min = min(0.98, max(eps_R, mu - gamma * sigma) * rho)
Pfail *= (1 - Ri_min)
hedge_set.append(cand)
if 1 - Pfail >= tau:
break
# 4 并行执行对冲子集
all_results = parallel_run(hedge_set, role_event.payload)
success_cands = [res for res if res.success]
# 选出最优结果
if success_cands:
winner = max(success_cands, key=lambda x:get_Uplus(x.candidate))
output = winner.response
else:
output = None # 全部失败,抛出恢复信号
# 5 异步采集所有轨迹更新画像
async_update_profiles(all_results)
return output
4 实验设置与结果
4.1 实验环境
仿真环境
三层执行区域:Local/Regional/Global,自定义网络模拟器配置时延、抖动、丢包、实例故障概率;底层多智能体基于DATAWISE框架,包含规划/编码/调试/过滤四类角色。
真实环境
Azure多区域OpenAI部署,美国东部、瑞典、东南亚、日本四机房,实测真实API往返时延作为网络指标。
三大评测基准
- DSBench:数据科学端到端建模分析;
- InfiAgent-Bench:结构化CSV多轮数据分析;
- MatplotBench:自然语言生成科学可视化图表。
对比基线
- Random:随机单候选执行;
- BestOne:历史最优单候选固定调度;
- MoA Best-of-N:全候选并行后打分择优;
- Fixed-Local/Regional/Global:仅使用单一区域所有候选。
4.2 动态故障可靠性实验
在第50个任务后注入网络/算力降级扰动:
- BestOne基线稳定性最差,一旦最优区域故障,全失败率提升70个百分点以上;
- Random分散但无冗余容错机制,故障场景大幅下滑;
- MoA可靠性最高,但token开销翻倍;
- HACO自动缩减高故障区域候选占比,自适应扩充低故障区域对冲集,故障场景失败率远低于单路由,同时避免全量并行成本。
真实Azure机房中断测试中,HACO自动切换至东南亚、日本机房完成推理,BestOne持续访问故障美国区域。

4.3 基准综合雷达图指标
评价维度:任务有效得分、严格通过率、token效率、时延效率、全步骤失败率。
- 单路由基线:低成本但可靠性极差;
- MoA:可靠性拉满,算力与时延开销显著上升;
- HACO雷达覆盖面积均衡,同时兼顾高通过率、可控开销,实现三者最优权衡。

4.4 自适应冗余行为分析
- 简单任务对冲集平均规模23,复杂多轮数据分析任务自动扩充至57;
- 不会固定依赖单一区域,动态均衡多机房候选并行;
- 随任务迭代,经验画像更新后,对冲集整体规模逐步收敛,算力开销持续下降。

4.5 可靠度τ消融实验
可靠阈值τ\tauτ从0.7提升至0.95:步骤失败率持续下降,但平均token消耗线性上升,HACO提供可调节性能-成本旋钮,业务可按需配置容错等级。

4.6 组件消融实验
移除网络时延建模/乐观探索分数/保守终止条件任一模块,整体任务得分显著下跌:
- 无环境感知时延建模:无法区分跨区链路代价,对冲集冗余无意义;
- 移除不确定性乐观项:新优质候选长期无法进入子集;
- 去掉保守可靠终止:提前停止并行,故障场景失败率飙升。
三模块缺一不可,协同构成完整自适应对冲调度能力。
5 结论
本文提出HACO对冲式智能计算调度框架,针对跨区域动态部署多智能体系统,将单次角色调用转化为带可靠性约束的最小并行子集优化问题。依靠Beta分布建模候选推理能力、跨区网络时延故障画像,结合乐观排序+保守终止自适应生成对冲并行集合;所有执行轨迹异步采集迭代更新全局调度经验。
仿真网络扰动与真实Azure云机房故障实验证明:相比单路由、全并行基线,HACO在动态不稳定环境大幅提升任务完成鲁棒性,同时可控推理开销,平衡精度、可靠性、算力成本。
局限性
- 当前调度仅针对静态角色集合,未支持运行时新增自定义角色;
- 未研究多智能体之间跨角色全局协同对冲;
- 经验采集依赖LL裁判打分,小型本地模型裁判存在评估偏差。
未来拓展
- 多角色全局联合对冲调度;
- 离线预训练候选画像,降低冷启动阶段性能损失;
- 适配容器弹性扩缩容的动态候选池调度。
附录
附录A 主流云跨区域推理机制调研
整理Azure、AWS Bedrock、GCP Vertex、Cloudflare Workers、Fireworks AI多区域部署能力,表格对比各平台路由、数据隔离、弹性调度特性,证明跨区部署已是工业标准,动态调度具备现实落地价值。
附录B HACO与各类LLM调度范式对比
对比LLM单路由、串行降级、批量推理、MoA全并行、HACO对冲调度的控制目标、执行模式、核心差异,明确HACO创新点在于执行前自适应冗余子集分配,区别于执行后结果融合、故障后重试等传统方案。
附录C 完整实验部署文档
C.1 DATAWISE多智能体配置
规划/编码/调试/过滤四角色有限状态机完整工作流、状态转移信号定义。
C.2 仿真网络模拟器完整参数
三层区域链路时延、抖动、带宽、丢包配置;消息传输时延计算公式、超时惩罚规则、伪代码。
C.3 Azure真实环境部署配置
四区域OpenAI模型版本、温度、采样超参、API调用采集时延脚本。
C.4 全部基线完整实现伪代码
Random、BestOne、MoA、固定区域调度运行脚本。
附录D 算法超参、消融原始数据表
- HACO核心超参:λ\lambdaλ探索系数、γ\gammaγ保守系数、可靠阈值τ\tauτ;
- 故障扰动、阈值消融、组件消融完整原始数值表格;
- 各基准单任务对冲集平均大小、token消耗统计。
附录E 雷达图、行为分析完整原始指标
各基线严格通过率、token开销、时延、失败率原始统计数据。
资源下载汇总
- 论文HTML原文:https://arxiv.org/html/2607.19215v1
- 论文PDF:https://arxiv.org/pdf/2607.19215
- 完整开源仓库:仿真网络模拟器、HACO调度代码、DATAWISE多智能体适配层、批量评测脚本、消融实验一键运行程序
- 部署文档:仓库README包含仿真/真实Azure两套环境安装、启动命令、超参配置教程