一、Hermes-Agent 技术架构(结合源码结构的真实形态)
基于 repo 结构(agent/, acp_registry/, cron/, skills/, gateway 等)和官方说明,可以抽象为下面这个真实工程架构:

二、核心技术概念(不是泛泛 Agent,而是它的"特有机制")
1️⃣ Skill = 程序化记忆(最关键)
Hermes 的核心抽象不是 Tool,而是:
Skill = 可复用的"解决方案模板"
-
以
SKILL.md存储(类似 DSL) -
包含:
-
任务描述
-
步骤
-
调用工具方式
-
-
可被自动加载和触发 (NOUS RESEARCH)
👉 本质:
LLM Prompt → 演化成 可执行策略
这比 LangChain 的 tool 更高一层。
2️⃣ Memory 体系
Hermes 的 memory 是多层的:
-
会话日志(raw)
-
FTS5 全文搜索(SQLite)
-
LLM summary(跨 session recall)
-
USER profile(用户建模) (GitHub)
👉 关键点:
它不是"查知识",而是"查经验"
3️⃣ Subagent(并行执行)
-
每个子 agent:
-
独立上下文
-
独立工具
-
-
支持并行 pipeline (GitHub)
👉 等价于:
DAG + 分布式 Agent 执行
4️⃣ Tool RPC 系统
-
Python script 可调用工具
-
工具通过 RPC 执行
-
避免 token 消耗(zero-context execution)
👉 关键价值:
把 LLM 从"执行器"变成"调度器"
5️⃣ Multi-model routing
-
支持 200+ 模型切换 (GitHub)
-
可动态切换推理模型
👉 类似:
Router → 根据任务选模型
三、最关键问题:自学习能力是怎么实现的?
这是 Hermes 的核心创新。
closed learning loop(闭环学习) (GitHub)
🧠 核心机制拆解(非常关键)
3.1、Learning Loop(自学习)的本质一句话
Hermes 的"自学习"不是训练模型,而是:
把执行轨迹(trajectory)变成可复用的"策略程序(Skill)"
3.2、核心闭环架构图

3.3 、Learning Loop 分解(真正实现逻辑)
1️⃣ Step 1:Trajectory Capture(轨迹记录)
每次任务执行时,系统记录:
css
User Input
→ LLM 思考过程
→ Tool 调用序列
→ 每一步结果
→ 最终输出
👉 本质是:
bash
execution trace log
2️⃣ Step 2:Reflection(反思阶段)
任务结束后触发:
csharp
success ? failure ? partial success ?
然后 LLM 会做:
- 哪些步骤是重复的
- 哪些是可以抽象的
- 是否有固定 pattern
👉 关键点:
这里不是训练模型,而是"总结经验"
3️⃣ Step 3:Pattern Extraction(模式提取)
系统会把:
"具体执行步骤"
转成:
"通用策略模板"
例如:
arduino
run simulation → extract waveform → analyze signal
变成:
markdown
RTL debug pattern:
1. run sim
2. extract signals
3. check condition
4️⃣ Step 4:Skill Synthesis(技能生成)
核心步骤:
objectivec
LLM → 将 pattern 转成 SKILL.md
Skill 包含:
-
适用条件
-
执行步骤
-
调用工具
👉 本质:
LLM 写"自动化脚本(高级版 prompt program)"
5️⃣ Step 5:Skill Store(存储)
Skill 被存入:
diff
- SKILL registry
- local file (SKILL.md)
并建立索引:
- embedding
- keyword
- context tag
6️⃣ Step 6:Future Matching(复用)
下次任务:
lua
User input → semantic match → skill hit
流程:
sql
query
↓
embedding search
↓
best skill match
↓
direct execution
7️⃣ Step 7:在线优化(最关键)
Skill 不是静态的:
执行失败 → 修改 skill
执行成功 → 强化 skill
👉 形成闭环:
不断进化的执行策略库
3.4、Learning Loop 本质(工程视角总结)
Hermes 的学习不是"训练模型"
而是:
把 LLM 的一次执行过程 → 转化为"可执行程序(Skill)"
它的本质循环是:
sql
执行(Execution)
↓
记录(Trajectory)
↓
抽象(Pattern)
↓
生成(Skill)
↓
复用(Reuse)
↓
优化(Refine)
3.5、结合你 RTL 场景(非常重要)
第一次
arduino
分析 ALU overflow
→ LLM 推理 + tool 调用
→ 找出问题
Hermes 学习后
生成 Skill:
arduino
RTL overflow check:
1. run sim
2. extract alu_out
3. check sign bit
4. compare carry
第二次
直接调用 skill
→ 不再推理
→ 直接执行
3.6 一句话总结
Hermes 的 Learning Loop 本质是一个"经验程序化系统",它通过记录 Agent 执行轨迹,将成功的任务执行过程抽象为 Skill,并在后续任务中通过语义匹配实现自动复用,从而让系统在使用过程中不断提升执行效率与稳定性,而不是通过模型训练提升能力。
四、它本质上属于哪类 AI 架构?
可以精准定义为:
👉 "Agentic Operating System"
融合了:
| 领域 | 对应实现 |
|---|---|
| LLM Agent | ReAct loop |
| RAG | Memory + FTS |
| AutoGPT | 多步任务 |
| RL | trajectory + improvement |
| 编译器 | Skill生成 |
| OS | tool + process + scheduler |
五、为什么它比普通 Agent 强
普通 Agent:
LLM → Tool → 输出
Hermes:
LLM → Tool → 总结 → Skill → Memory → 自优化 → 下一次更强
👉 多了一个:
经验沉淀层(Experience Layer)
六、重点理解的 3 个"精髓"
如果你要复刻/理解 Hermes,只抓这三个:
1️⃣ Skill System(核心抽象)
→ 把经验变成"程序"
2️⃣ Learning Loop(闭环)
→ 自动生成 + 优化 skill
- Execute task
- Record trajectory
- Analyze success/failure
- Extract reusable pattern
- Store as skill
- Reuse in future tasks
3️⃣ Memory + Retrieval(经验驱动)
→ 不是知识,是行为模式