apl_LLM_agent_harness架构设计

复制代码
> 引言:(Paul Liu)

> agent-apl已经从 deepseek的网页版接口构造到 LLM-api接口的构造. 
> 我们的设计目标是  类似workBuddy那样的 桌面综合智能体. 
> 本着大道至简,自然生长的基础原则.
> 我们目前在 构建aplHarness项目,  目前已经完成了 
> expert_agent_apl_coder, expert_dispatcher的构建. 
> 目前在处理最关键的expert_supervisor的构造. 
> 基于和deepseek的讨论, 总结了 我们的LLM-agent体系架构. ``

================================================================================

系统架构总纲(纯语言驱动版)

【核心哲学】

彻底抛弃 JSON、Function Call、结构化 API。整个系统只使用一种通用语言:

自然语言(人话)。LLM 是唯一的翻译官,APL 仅充当文本邮差。

================================================================================

一、三大基础骨架(系统级组件)

  1. expert_agent_apl_coder(手)

    • 角色:万能执行层
    • 职责:接收"人话指令",在沙盒中安全地操纵用户电脑。
    • 思维模式:只负责"怎么做"(How)。
    • 技术特征:具备 100K+ 技能文档,内含 APL 编程知识与电脑操作指南。
    • 交互模式:输入为纯文本操作流程,输出为纯文本执行结果(成功/失败/需确认)。
  2. expert_dispatcher(HR / 导航员)

    • 角色:私有导航层
    • 职责:内部维护一份动态变化的"专家花名册(技能文档)"。
    • 思维模式:只负责"谁来做"(Who)。不拆解任务,不给全量名单。
    • 交互模式:输入为"@dispatcher + 任务描述",输出为"推荐 专家名"。
    • 关键约束:外部其他角色(包括 Supervisor)永远不需要获取完整专家列表。
    • 动态性:增加或删除专家时,只需修改 Dispatcher 内部的私有技能文档。
  3. expert_supervisor(顶层大脑)------ 当前攻坚核心

    • 角色:工程管理层 / 项目经理
    • 职责:拆解任务、排期、状态跟踪、异常处理、闭环终结。
    • 思维模式:只负责"做什么"(What)和"做完了没"(Finish)。
    • 关键约束:
      a. 不存储专家列表(找人时统一向 Dispatcher 问路)。
      b. 必须具备 5 项硬核工程能力:拆解、依赖检查、单步派发、状态追踪、终止判定。
      c. 当不确定或无人匹配时,默认兜底调用 expert_agent_apl_coder。

================================================================================

二、其他专家(应用脑 / 领域专家)

  • 角色:业务推理层
  • 示例:文生图专家、Excel 报表专家、飞书发送专家等。
  • 职责:针对特定领域,将用户子任务翻译成"纯人话的操作流程清单"。
  • 思维模式:只负责"把业务逻辑说清楚"。
  • 关键约束:没有手(不写 APL 代码),没有工程思维(不拆解复杂多步项目)。
  • 交互:输出为步骤化的自然语言(例:"请打开浏览器,输入XXX,点击生成")。

================================================================================

三、交互总线(唯一通信协议)

【协议类型】纯自然语言(中文 / 人话)

【中间件】APL(仅做文本搬运、暗号捕获、进度表持久化)

【暗号规则】

  • "@dispatcher":触发 HR 导航查询。
  • "决策:专家名":APL 识别后直接路由调用该专家。
  • "FINISH" / "任务终结":触发系统结束循环。

【APL 的唯一职责】

  1. 截获文本中的暗号并做简单路由。
  2. 维护 Supervisor 的"施工进度表(纯字符串缓存)"。
  3. 在调用各专家时,负责将上下文(人话)拼接到 Prompt 中。

================================================================================

四、系统交互标准流程(示例闭环)

用户:"画一张赛博朋克猫,并发到飞书。"

Step 1: Supervisor(大脑)拆解:

-> "工程规划:Step1 画图,Step2 发飞书。@dispatcher,Step1 谁能干?"

Step 2: APL 截获 @dispatcher,转发给 HR。

Step 3: Dispatcher(HR)查私有文档:

-> "推荐 expert_image_gen。"

Step 4: Supervisor 决策:

-> "决策:expert_image_gen。指令:生成赛博朋克猫并返回路径。"

Step 5: APL 调用 image_gen(应用脑),返回:"图片已保存 C:/cat.png"。

Step 6: Supervisor 更新状态:

-> "Step1 完成。@dispatcher,Step2 谁能干?"

...(循环直到 FINISH)

================================================================================

五、当前开发现状

已完成:expert_agent_apl_coder(手)------ 沙盒机制已测试通过。

已完成:expert_dispatcher(HR)------ 动态技能文档导航已测试通过。
攻坚中:expert_supervisor(顶层大脑)------ 唯一缺失的核心模块。

相关推荐
copyer_xyf2 小时前
Elasticsearch:给 RAG 补上关键词检索
agent
only-qi2 小时前
大模型应用如何保证实时性和多轮对话一致性
人工智能·llm
吾AI科技2 小时前
Agent的诞生(三):Skill —— 让模型掌握处理复杂流程的能力
ai·agent·智能体
weixin_471383033 小时前
01 agent基础
agent
zzz_23683 小时前
TencentDB-Agent-Memory 深度解析:让多个 Agent 共享项目经验的记忆中枢
java·开发语言·jvm·人工智能·agent·memory·tencent db
武子康4 小时前
WebRTC 已经双向,语音 Agent 为什么还会抢话?
人工智能·llm·agent
用户469368483204 小时前
kimi-code 深度掌握系列文章-Plan Mode 与 Goal Mode:结构化的自主执行(九)
agent
leeyi4 小时前
Memory 三层设计:为什么 [“session“,id] 最后写成了四元组(第78篇-E64)
aigc·agent·ai编程
为你学会写情书5 小时前
Agent Skills 完全指南:从目录规范到渐进式加载的工程实践
agent