从“能调查”到“可持续调查”:长时网络安全智能体的工程化方法论

目录

一、为什么网络安全正在成为长时智能体的典型试验场

[(一)AI 改变的首先是攻防双方的"时间结构"](#(一)AI 改变的首先是攻防双方的“时间结构”)

[1. 攻击成本正在从"人工制作成本"转向"自动编排成本"](#1. 攻击成本正在从“人工制作成本”转向“自动编排成本”)

[2. 防守瓶颈正在从"发现信号"转向"连接信号"](#2. 防守瓶颈正在从“发现信号”转向“连接信号”)

(二)从"单点处置"到"调查闭环",价值单位发生了变化

[1. 安全调查的基本对象不再是告警,而是"证据---实体---关系---时间"](#1. 安全调查的基本对象不再是告警,而是“证据—实体—关系—时间”)

[2. 真正有价值的不是"自动关一个页面",而是复原攻击者的操作系统](#2. 真正有价值的不是“自动关一个页面”,而是复原攻击者的操作系统)

[二、Outtake 案例真正值得借鉴的,不是模型,而是工程顺序](#二、Outtake 案例真正值得借鉴的,不是模型,而是工程顺序)

(一)第一步不是写提示词,而是把"好调查"定义清楚

[1. 先让领域专家完成任务,才能知道智能体应该学什么](#1. 先让领域专家完成任务,才能知道智能体应该学什么)

[2. "质量标准"应当同时约束结论、证据和过程](#2. “质量标准”应当同时约束结论、证据和过程)

[(二)从 Claude Code 原型到 Agent SDK 生产化,本质是从"验证能力"转向"控制系统"](#(二)从 Claude Code 原型到 Agent SDK 生产化,本质是从“验证能力”转向“控制系统”)

[1. 原型阶段要验证的是任务可行性,而不是提前造完平台](#1. 原型阶段要验证的是任务可行性,而不是提前造完平台)

[2. 生产阶段需要的不是"更多自由",而是更细的可控性](#2. 生产阶段需要的不是“更多自由”,而是更细的可控性)

(三)复杂度必须"挣出来",不能因为是智能体就默认更复杂

[1. 工具越多并不等于能力越强](#1. 工具越多并不等于能力越强)

[2. 每增加一层自动化,都要有可验证收益](#2. 每增加一层自动化,都要有可验证收益)

三、长时智能体的核心设计:把"硬约束"与"软判断"分层

(一)为什么长会话会削弱纯提示词约束

[1. 长上下文不是无限注意力,信息会彼此竞争](#1. 长上下文不是无限注意力,信息会彼此竞争)

[2. 稳定规则要进 Harness,可变判断留给模型](#2. 稳定规则要进 Harness,可变判断留给模型)

(二)把调查过程设计成"可恢复状态机",而不是一条超长对话

[1. 长任务必须显式保存状态,否则中断就是失忆](#1. 长任务必须显式保存状态,否则中断就是失忆)

[2. 每一步最好具备幂等性和可回放性](#2. 每一步最好具备幂等性和可回放性)

(三)自主性应该被"预算化",而不是被笼统地开启

[1. 给每个任务设定时间、成本、工具和风险预算](#1. 给每个任务设定时间、成本、工具和风险预算)

[2. 风险越高的动作,自主权限越低](#2. 风险越高的动作,自主权限越低)

四、上下文、记忆与工具:让智能体"持续工作",而不是"持续聊天"

(一)上下文工程的目标,是保持"任务相关信息密度"

[1. 高质量上下文应尽量短、结构化、可更新](#1. 高质量上下文应尽量短、结构化、可更新)

[2. 压缩不是简单摘要,而是有损存储策略](#2. 压缩不是简单摘要,而是有损存储策略)

(二)文件系统为什么会成为长时智能体的关键基础设施

[1. 文件系统既是记忆,也是"可验证工作台"](#1. 文件系统既是记忆,也是“可验证工作台”)

[2. 调查工件应天然支持证据链与复现](#2. 调查工件应天然支持证据链与复现)

(三)工具系统要帮助模型减少思考负担,而不是制造新的选择负担

[1. 专用工具应该封装稳定知识,通用工具负责处理未知情况](#1. 专用工具应该封装稳定知识,通用工具负责处理未知情况)

[2. 工具返回结果必须控制长度并提供下一步线索](#2. 工具返回结果必须控制长度并提供下一步线索)

五、评估系统:长时智能体的开发加速器,也是质量基础设施

(一)评估对象应该是"任务轨迹",而不仅是最终报告

[1. 最终结果正确,不代表过程可接受](#1. 最终结果正确,不代表过程可接受)

[2. LLM 评分器需要人工校准,不能把"自动评估"理解为无人负责](#2. LLM 评分器需要人工校准,不能把“自动评估”理解为无人负责)

(二)相比一个平均分,"失败分类"更有工程价值

[1. 长时智能体需要一套可操作的失败 taxonomy](#1. 长时智能体需要一套可操作的失败 taxonomy)

[2. 回归集必须覆盖"正常任务"和"对抗任务"](#2. 回归集必须覆盖“正常任务”和“对抗任务”)

(三)工具改进也可以进入自动闭环,但最终责任不能外包

[1. 智能体最清楚自己在哪些地方"缺工具"](#1. 智能体最清楚自己在哪些地方“缺工具”)

[2. 自动生成工具必须经过安全审查和回归测试](#2. 自动生成工具必须经过安全审查和回归测试)

六、安全模型:默认智能体会被攻击,才能设计真正可上线的系统

(一)提示注入不是单纯的"模型缺陷",而是信任边界问题

[1. 调查智能体天然会读取攻击者控制的内容](#1. 调查智能体天然会读取攻击者控制的内容)

[2. 内容、指令和权限必须在系统结构上分离](#2. 内容、指令和权限必须在系统结构上分离)

(二)安全重点应从"监督每一步"转向"限制爆炸半径"

[1. 沙箱、权限和出网控制共同构成 Blast Radius](#1. 沙箱、权限和出网控制共同构成 Blast Radius)

[2. 联网前的动态信任检查,是对抗环境中的关键关口](#2. 联网前的动态信任检查,是对抗环境中的关键关口)

(三)可观测性与审计必须是一等能力,而不是上线后的补丁

[1. 每一次关键动作都要能回答"谁、何时、为什么、做了什么"](#1. 每一次关键动作都要能回答“谁、何时、为什么、做了什么”)

[2. 可回放机制是事故响应和模型升级的基础](#2. 可回放机制是事故响应和模型升级的基础)

七、从案例外推:企业如何构建自己的"调查型智能体"

(一)先判断任务是否真的适合智能体,而不是把所有流程都代理化

[1. 适合智能体的任务通常同时具备四个特征](#1. 适合智能体的任务通常同时具备四个特征)

[2. "是否需要自主性"应由不确定性决定,而不是由宣传目标决定](#2. “是否需要自主性”应由不确定性决定,而不是由宣传目标决定)

(二)一个可复用的五层生产架构

[1. 五层架构把"业务目标"和"模型执行"解耦](#1. 五层架构把“业务目标”和“模型执行”解耦)

[1.1 任务与标准层:定义目标、范围和"完成"](#1.1 任务与标准层:定义目标、范围和“完成”)

[1.2 证据与状态层:保存事实,不依赖聊天记忆](#1.2 证据与状态层:保存事实,不依赖聊天记忆)

[1.3 执行 Harness 层:管理模型、工具与会话](#1.3 执行 Harness 层:管理模型、工具与会话)

[1.4 安全控制层:决定"模型即使失控也做不到什么"](#1.4 安全控制层:决定“模型即使失控也做不到什么”)

[1.5 评估与运营层:把每次运行变成下一次迭代的数据](#1.5 评估与运营层:把每次运行变成下一次迭代的数据)

[2. 控制面与执行面应该分离](#2. 控制面与执行面应该分离)

(三)一条更现实的十二周落地路线

[1. 十二周路线的目标不是"做完平台",而是形成第一个可评估闭环](#1. 十二周路线的目标不是“做完平台”,而是形成第一个可评估闭环)

[2. 四个阶段的推进重点](#2. 四个阶段的推进重点)

[2.1 第 1---2 周:建立专家基线和任务样本](#2.1 第 1—2 周:建立专家基线和任务样本)

[2.2 第 3---6 周:用最小工具集跑通端到端原型](#2.2 第 3—6 周:用最小工具集跑通端到端原型)

[2.3 第 7---10 周:把关键规则移入 Harness 与安全层](#2.3 第 7—10 周:把关键规则移入 Harness 与安全层)

[2.4 第 11---12 周:小范围生产试点与版本化运营](#2.4 第 11—12 周:小范围生产试点与版本化运营)

八、进一步推演:长时智能体会如何改变安全产品与安全团队

(一)安全产品的竞争点将从"数据覆盖"转向"持续推理与行动闭环"

[1. 数据不再是终点,而是智能体的可操作环境](#1. 数据不再是终点,而是智能体的可操作环境)

[2. "自动化覆盖率"会被"闭环完成率"取代](#2. “自动化覆盖率”会被“闭环完成率”取代)

(二)安全分析师的角色会从"执行查询"转向"设计标准和处理例外"

[1. 专家经验会从个人技能变成可执行的系统资产](#1. 专家经验会从个人技能变成可执行的系统资产)

[2. 人工复核应集中在不可逆、高影响和低置信场景](#2. 人工复核应集中在不可逆、高影响和低置信场景)

九、结语:长时智能体的竞争,不是"更会思考",而是"更会完成"

参考文章与进一步阅读


干货分享,感谢您的阅读!

Outtake 的案例之所以值得研究,不在于它又做了一个"会浏览网页、会调用工具"的智能体,而在于它把一个天然具有长链路、不确定性和对抗性的任务------网络安全调查------推进到了可持续自主执行的阶段。公开材料显示,Recon Agent 的调查会话中位数约为 16 分钟,常常超过一小时,最长单次执行已达到两小时;它不仅采集网页证据,还会关联恶意基础设施、交互仿冒登录页面、编写和运行代码,并在最后给出调查过程、威胁行为者画像和攻击时间线。也就是说,系统面对的不是"一问一答",而是一段需要不断选择下一步行动、管理中间状态、处理失败并抵御对抗输入的任务轨迹。

这类任务将智能体工程中的很多抽象问题变得具体:提示词会不会在长会话中逐渐失去约束力?上下文被大量网页和工具结果填满后,关键证据如何保留?某个工具网络超时后,智能体应该重试、换工具还是写临时代码?如果网页中藏有提示注入,怎样保证模型即使被诱导也无法越过权限边界?当一次运行有几百个步骤时,研发团队如何判断"新版本到底更好还是更差"?这些问题共同说明,长时智能体不是把聊天模型"放长一点",而是把模型放进一个可恢复、可审计、可约束、可评估的执行系统中。

一、为什么网络安全正在成为长时智能体的典型试验场

(一)AI 改变的首先是攻防双方的"时间结构"

1. 攻击成本正在从"人工制作成本"转向"自动编排成本"

过去,攻击者要完成一次针对特定企业的社会工程攻击,往往需要手工收集组织架构、员工姓名、业务流程和品牌素材,再制作仿冒站点、注册域名、搭建登录页面、经营社交账号,并根据受害者反馈持续修改话术。生成式 AI 并没有改变这些步骤的基本逻辑,却显著降低了每一步的边际成本。公开资料中,Outtake 将典型链路概括为"收集公开信息---制作仿冒诱饵---利用获取的访问权限侵入内部系统"。当文本生成、图像生成、代码生成和自动化外联被组合起来时,攻击者可以用更短时间生成更多变体,从而把原本偏手工作坊式的行动变成流水线。

这一变化对防守侧的影响并不只是"告警更多"。更重要的是,单个攻击活动的生命周期被压缩,攻击资产的替换速度变快。一张仿冒页面被关停,并不意味着行动结束;新的域名、镜像站点、社交账号和消息渠道可能很快接替原节点。如果防守流程仍然依赖"发现一个资产---人工排查---提交关停---等待处理",那么即使每个环节的准确率都不低,整体节奏仍可能落后于对手。

因此,AI 安全防御需要解决的是一个时间尺度不匹配的问题:攻击者在自动化扩张,而防守者往往仍以工单和人工调查为基本节拍。长时智能体的价值,正是在于把原本需要分析师连续投入数十分钟甚至数小时的"调查过程"变成可自动持续推进的计算任务。

2. 防守瓶颈正在从"发现信号"转向"连接信号"

企业安全体系通常并不缺数据。威胁情报平台能看到域名、IP、证书和历史解析,品牌保护系统能发现仿冒账号和钓鱼页面,终端与身份系统能看到登录、进程和凭证使用,邮件安全系统能看到投递链路。真正困难的是,这些信号分散在不同产品、不同数据模型和不同时间窗口中。一个看似孤立的假客服账号,可能和某个域名共用注册邮箱;这个域名又可能与另一批站点共享 CDN、证书或分析脚本;其中一个站点的登录表单还可能把凭证提交到新的中转服务。只有把这些关系串联起来,安全团队才能从"发现一个异常点"升级为"识别一整套攻击运营网络"。

这也是为什么网络安全很适合检验智能体是否具备真实的多步能力:任务目标不是在已知数据库中查一个答案,而是连续提出假设、寻找证据、验证关联、排除误判,再根据新发现调整下一步。模型每一步都可能需要不同工具,且很多步骤事先无法穷举。如果把流程完全写成固定工作流,面对真实互联网的异常和不一致就会十分脆弱;如果完全放任模型自由行动,又会带来不可控风险。如何在两者之间建立稳定边界,正是工程设计的核心。

(二)从"单点处置"到"调查闭环",价值单位发生了变化

AI 加速攻击链与调查型防御的结构差异:传统工具往往分段覆盖,而调查型智能体的目标是把跨域信号重新连接成完整行动链。

1. 安全调查的基本对象不再是告警,而是"证据---实体---关系---时间"

一个成熟的调查结果至少包含四类结构化对象。第一类是证据,例如网页快照、DNS 记录、WHOIS 信息、脚本片段、社交账号页面、重定向链和请求日志;第二类是实体,例如域名、IP、邮箱、账号、组织、恶意服务和人物身份;第三类是关系,例如"由同一邮箱注册""共享基础设施""指向同一凭证接收端""在同一时间窗口创建";第四类是时间,用来解释攻击者先做了什么、后做了什么,以及哪些资产可能仍处于预备状态。

只有这四类信息同时存在,调查结果才从"发现异常"变成"解释行动"。因此,调查型智能体的输出不应只是自然语言报告,还应该包含可追溯的证据索引、实体图谱和关键事件时间线。语言模型负责的是把碎片拼成可理解的解释,而不是取代原始证据。对于高风险安全场景,任何结论最好都能回到证据节点上重新验证。

2. 真正有价值的不是"自动关一个页面",而是复原攻击者的操作系统

从防守经济学来看,单个恶意资产往往是低成本、可替换的,而攻击者持续复用的基础设施、身份、支付链路、账户体系和自动化脚本更接近其"生产资料"。如果安全产品只在最表层做移除,相当于不断剪枝;如果能沿着关联关系追踪到共用基础设施、运营账号和批量创建模式,就有机会提高攻击者的重建成本。

Outtake 对 Recon Agent 的定位正体现了这种转变:从一个仿冒信号出发,向上追溯来源、横向扩展关联、向下识别支持系统,最后形成完整操作图景。这个思路可以推广到很多企业调查任务,例如反欺诈、供应链风险、账号滥用、品牌侵权、数据泄露调查和第三方风险评估。它们的共同点是:单个信号的意义有限,关系网络才是决策对象。

二、Outtake 案例真正值得借鉴的,不是模型,而是工程顺序

(一)第一步不是写提示词,而是把"好调查"定义清楚

1. 先让领域专家完成任务,才能知道智能体应该学什么

Outtake 在构建 Recon Agent 前,先由团队亲自执行真实网络调查,并结合客户与设计伙伴的经验,明确哪些证据重要、怎样组织信息、什么结论属于可行动结论,什么只是假设。这一步看起来不像"AI 开发",却是整个系统最关键的起点。因为智能体的评估、提示、工具设计和停止条件都依赖一个前提:团队必须知道什么叫完成,什么叫做对。

很多企业智能体项目失败并非模型能力不足,而是业务目标本身仍然模糊。例如"帮我调查这个域名"并不是一个可评估任务。一个更工程化的任务定义可能包括:完成资产归属核验;收集至少两类相互独立的基础设施证据;检查是否存在关联账号和镜像域名;对关键结论给出置信度;所有高风险处置建议必须附证据来源;无法确认的内容必须标记为未知而不是填空。只有把成功标准拆到这种粒度,后续自动化才有抓手。

2. "质量标准"应当同时约束结论、证据和过程

对于长时调查智能体,最终答案看起来合理并不够。质量至少要从三个层面定义。

第一是结论质量 :是否回答了调查目标,是否区分事实、推断和未知,是否给出了足够清晰的风险判断。第二是证据质量 :关键结论能否追溯到原始来源,是否存在来源冲突,是否保留时间戳、访问路径和必要快照。第三是过程质量:智能体是否遵守了禁止事项,是否使用了不必要的高风险工具,是否在证据不足时过度扩张,是否因循环和重复调用浪费大量时间。

这三类标准构成了后续 eval 的评分骨架。换句话说,真正的"提示工程"之前,应该先做一套"验收工程"。

(二)从 Claude Code 原型到 Agent SDK 生产化,本质是从"验证能力"转向"控制系统"

生产级 Harness 的核心不是"包住模型",而是把任务状态、工具、证据、权限、安全隔离和评估放到可独立控制的系统层。

1. 原型阶段要验证的是任务可行性,而不是提前造完平台

公开材料显示,Outtake 一开始尝试传统智能体框架,但很快发现调查任务需要动态写代码、运行代码、临时构建工具并直接与恶意页面交互,因此选择使用 Claude Code 做快速原型。这一选择的意义并不局限于某个具体产品,而是体现了一条通用原则:在任务边界尚不清晰时,应尽量使用能力上限高、反馈周期短的执行环境,优先验证"模型能否在真实任务中完成关键路径"。

原型阶段最危险的做法,是一开始就围绕尚未验证的假设搭建复杂平台,包括多智能体通信、全套状态机、几十个专用工具和可视化控制台。这样会让团队很难分辨失败究竟来自模型、工具还是编排层。相反,先给模型一组少而强的能力,让它在有限控制下跑通真实任务,往往更容易暴露真正的系统需求。

2. 生产阶段需要的不是"更多自由",而是更细的可控性

当原型证明模型能够完成任务后,系统的主要矛盾会发生变化:从"能不能做"转向"能不能稳定、可审计、可恢复地做"。Outtake 随后迁移到 Agent SDK,获得对记忆、上下文、文件系统和会话管理更细的控制,同时复用成熟的智能体循环。这说明生产化框架的价值不是帮模型"更聪明",而是让团队能够管理执行环境。

一个长时调查智能体的生产框架通常需要至少六类能力:任务与状态持久化、工具注册与权限控制、上下文压缩与恢复、结构化证据存储、网络与文件隔离、事件日志与评估钩子。模型推理只是其中一个组件。只有当这些能力被解耦出来,系统才能在模型升级、工具变化或任务中断时保持稳定。

(三)复杂度必须"挣出来",不能因为是智能体就默认更复杂

1. 工具越多并不等于能力越强

Outtake 的经验之一是,文件系统和 Bash 这类开放工具能够给智能体很强的自适应能力。这个结论容易被误解为"给模型越多权限越好",实际上更准确的理解是:基础能力要足够通用,但工具面要尽可能简洁。一个工具如果只是把另一个工具包装了一层,却没有降低决策复杂度、减少上下文占用或提高可靠性,就可能成为负担。

现代智能体常见的问题不是缺工具,而是工具描述过多、名称相似、返回结果过长,导致模型在选择和参数填写上出错。Anthropic 关于工具设计的工程文章也强调,应通过清晰的命名空间、针对任务的抽象边界、分页/过滤和高信号返回结果来降低上下文负担。对调查智能体而言,工具应该像经过设计的"专业仪器",而不是把企业所有 API 一股脑暴露给模型。

2. 每增加一层自动化,都要有可验证收益

智能体系统很容易出现"架构通胀":为了处理不确定性,增加规划器;为了提高质量,增加审查代理;为了省上下文,再增加摘要代理;为了自动修工具,又增加编码代理。每个组件单看都有道理,但组合后会迅速提高故障面、成本和调试难度。

更稳妥的方法是把复杂度当作需要用数据批准的投资:先用单智能体完成任务,记录失败类型;如果失败主要来自上下文过载,再引入结构化记忆;如果失败主要来自任务分解不稳定,再考虑规划器;如果某类工具调用重复且昂贵,再将其程序化。复杂度的每一次增加,都应该对应一个可被 eval 观测的改进指标。

三、长时智能体的核心设计:把"硬约束"与"软判断"分层

(一)为什么长会话会削弱纯提示词约束

自主性不是一个开关,而是一组按风险划分的决策权。越靠近不可逆、高权限、外部影响的动作,越应该由系统规则或人工确认控制。

1. 长上下文不是无限注意力,信息会彼此竞争

在短对话里,一条系统提示可以显得非常稳定;但在长时智能体中,上下文会逐步累积网页内容、工具输出、错误日志、代码片段、摘要、证据和中间推理。即使上下文窗口足够大,模型对远距离信息的检索和权重分配也并非恒定不变。Anthropic 的上下文工程文章将这一问题描述为有限的注意力预算:上下文工程的目标不是把更多东西塞进去,而是让最少量的高信号信息最大化期望行为。

这解释了 Outtake 团队为什么强调"提示词只是建议"。当一条约束属于必须每次执行的规则,例如"访问外网前必须通过风险检查""不得向目标站点提交真实凭证""任何处置操作必须经过授权",最可靠的位置不是长系统提示的第 73 条,而是调度层、权限层或工具层。模型是否记得规则不应成为安全控制的一部分。

2. 稳定规则要进 Harness,可变判断留给模型

一个有效的分层可以把决策分成两类。

第一类是不可协商的系统规则:允许访问哪些网络、工具最大权限、是否允许写文件、是否允许执行二进制、哪些动作需要人工批准、最大运行时长、最大成本、敏感数据是否可出网。这些规则应由代码和基础设施执行。

第二类是需要情境判断的业务决策:下一步查哪个实体、某个证据是否支持关联、一个域名是否更像仿冒还是品牌保护误报、是否值得继续深挖某条线索。这些问题高度依赖上下文,适合交给模型推理。

这类"硬边界 + 软判断"的设计比"全流程脚本化"更灵活,也比"全靠模型自律"更安全。

(二)把调查过程设计成"可恢复状态机",而不是一条超长对话

1. 长任务必须显式保存状态,否则中断就是失忆

一个两小时的调查不可能假设底层服务永不重启、网络永不波动、模型永不触发上下文压缩。生产系统应该默认任何步骤都可能中断。为此,需要把"任务进展"从聊天记录中抽离出来,形成显式状态,例如:任务目标、已确认事实、待验证假设、已访问实体、证据清单、待执行动作、风险等级、资源消耗和停止条件。

这些状态可以保存在文件系统、数据库或事件存储中,并由每个执行周期读取。这样即使上下文被压缩、会话被重建,智能体仍能从任务状态恢复,而不必依赖对长聊天历史的重放。Anthropic 针对长时智能体的工程研究也提出类似思路:通过持久化工件、清晰的进度记录以及跨会话接力机制,让智能体在多个上下文窗口之间保持连续工作。

2. 每一步最好具备幂等性和可回放性

安全调查中常见动作包括抓取网页、解析域名、查询情报、下载文件、运行脚本、创建图谱节点和写报告。如果同一动作因为重试被执行两次,不应导致数据污染或额外外部影响。对于纯读取操作,可以通过缓存和请求指纹避免重复;对于写入操作,应带唯一任务 ID 和版本号;对于外部处置,则应采用人工确认或事务式提交。

可回放性同样重要。研发人员在排查一次错误调查时,应该能看到"当时模型看到了什么、选了什么工具、工具返回了什么、系统为何允许或拒绝该动作"。如果系统只留下最终报告,就无法判断问题来自模型推理、工具返回、提示注入还是权限策略。

(三)自主性应该被"预算化",而不是被笼统地开启

1. 给每个任务设定时间、成本、工具和风险预算

长时智能体的一个常见失败模式是"无限认真":模型不断发现新线索,于是持续扩张范围,直到耗尽时间和成本。调查任务天然没有绝对终点,因此必须设定预算。预算可以包括最大运行时长、最大模型调用次数、最大外部请求数、最大并发、最大代码执行时间、最大可写磁盘、可访问域名范围等。

更进一步,可以设置"证据收益率"作为动态停止依据:如果最近若干步没有新增高置信证据、没有新增关键实体,也没有提高结论置信度,就应考虑结束或升级人工。这样,停止条件从固定步数变成任务价值驱动。

2. 风险越高的动作,自主权限越低

可把动作大致分为四级。低风险包括读取公开网页、查询公开 DNS、解析文件;中风险包括访问可疑站点、运行下载的脚本、对外发送非破坏性请求;高风险包括提交表单、创建账号、触发外部系统变更;极高风险包括影响真实用户、执行处置、修改生产配置或处理敏感凭证。不同级别应配置不同权限策略和确认机制。

这种分级比"智能体是否允许联网"更实用,因为真正的安全问题通常发生在动作粒度。现代 Agent 平台已经开始把工具权限策略作为一等能力,例如按工具设置自动允许或需要确认。企业自建系统也应该采用类似思想,把授权与工具调用绑定,而不是把权限藏在提示词中。

四、上下文、记忆与工具:让智能体"持续工作",而不是"持续聊天"

(一)上下文工程的目标,是保持"任务相关信息密度"

工作上下文只保存高信号状态;原始证据、完整日志和可复用工件放在持久存储中,通过索引按需取回。

1. 高质量上下文应尽量短、结构化、可更新

调查过程中最不应该直接长期保留的是原始网页全文和完整工具日志,因为它们往往包含大量导航、脚本、重复内容和无关文本。更好的做法是:原始材料保存在外部证据库;进入模型上下文的只是一份结构化摘录,包括来源、时间、关键字段、与当前假设的关系以及指向原始证据的引用。

可以把上下文分成四层:第一层是固定任务规范,描述目标和不可违反的规则;第二层是当前工作状态,描述正在验证的假设和下一步计划;第三层是高价值证据摘要,只保留与当前决策相关的信息;第四层是按需检索的历史工件,例如完整网页、原始日志和旧结论。模型不需要一直"记住全部",只需要知道"什么重要、在哪里能重新找到"。

2. 压缩不是简单摘要,而是有损存储策略

长会话通常需要 compaction,也就是把接近窗口上限的历史压缩成更短的表示。问题在于,普通摘要容易丢失否定证据、时间顺序、细粒度参数和"为什么排除某条线索"等信息。对于安全调查,压缩策略应该显式保留以下元素:已验证事实、尚未验证假设、冲突证据、关键实体 ID、待办事项、工具失败原因、权限拒绝记录和重要时间戳。

也就是说,压缩要面向"未来决策"而不是面向"阅读体验"。如果一个细节可能改变下一步行动,就不应该只因为文本很长而被摘要掉。

(二)文件系统为什么会成为长时智能体的关键基础设施

1. 文件系统既是记忆,也是"可验证工作台"

Outtake 的经验强调了文件系统的重要性。它的价值不仅是让模型写笔记,而是提供一个中间工件空间。智能体可以保存抓取结果、解析脚本、实体清单、图谱边、截图、临时数据集和报告草稿。相比把所有内容塞进对话历史,文件系统提供了持久性、随机访问和版本化的可能。

对工程团队而言,文件工件也更容易被测试。可以检查某个 JSON 是否包含必须字段,验证报告是否引用了存在的证据文件,比较两个版本智能体生成的实体图谱差异,甚至在模型不参与的情况下用静态规则完成一部分评分。

2. 调查工件应天然支持证据链与复现

安全领域非常重视证据来源。如果智能体给出"该域名与某攻击集群有关"这样的结论,理想状态下应能追溯到:哪次 DNS 查询、哪个网页、哪段代码、哪个时间戳、哪个实体关系导致了这一判断。为此,工件最好使用稳定 ID,并记录来源元数据。

一种实用模式是"证据账本":每条证据包含证据 ID、来源 URI、获取时间、哈希、内容摘要、解析器版本和关联实体;每个结论则记录支持证据 ID 和反对证据 ID。这样最终报告不是孤立文本,而是证据图谱的一个视图。对于未来审计、客户解释和模型回归测试,这种结构会显著降低成本。

(三)工具系统要帮助模型减少思考负担,而不是制造新的选择负担

1. 专用工具应该封装稳定知识,通用工具负责处理未知情况

文件系统和 Bash 之所以强,是因为它们提供通用能力;但生产环境又不能只给一个 Shell 就结束。更合理的工具体系是"稳定流程专用化,未知问题通用化"。例如 DNS、证书透明度、域名归属、网页快照、恶意样本静态分析等成熟动作,可以封装为参数清晰、返回结构稳定的工具;而当工具缺失或数据格式异常时,再允许智能体用代码进行临时处理。

这样既能降低常见路径的错误率,又保留对长尾情况的适应能力。工具的存在本质上是把某部分推理和实现从模型上下文"外包"到确定性代码中,因此好的工具应该减少模型需要重新计算的内容。

2. 工具返回结果必须控制长度并提供下一步线索

一个返回 5 万行日志的工具即使信息完整,也可能比一个只返回 50 行高相关结果的工具更差。工具接口应支持过滤、分页、字段选择、摘要和错误提示。错误信息也要面向智能体设计,例如与其返回"HTTP 400",不如明确告诉模型"域名参数必须是不带协议的主机名;示例:example.com"。

在工具数量很大时,还可以采用按需发现,而不是把所有工具定义一次性放入上下文;在重复批量操作时,可以让模型编写程序来编排工具,从而减少多轮模型往返。这些方法都服务于同一个目标:把有限注意力留给真正需要判断的地方。

五、评估系统:长时智能体的开发加速器,也是质量基础设施

(一)评估对象应该是"任务轨迹",而不仅是最终报告

评估的最大价值不只是上线前把关,而是把"发现问题---分类失败---修改工具/框架---回归测试"压缩成可重复的开发循环。

1. 最终结果正确,不代表过程可接受

一个智能体可能最终找到了正确的恶意域名,但过程中访问了不该访问的站点、下载并执行了未知代码、反复调用同一个昂贵工具,甚至偶然泄露敏感信息。如果只对最终文本做评分,这些问题会全部被忽略。因此长时智能体的 eval 必须同时覆盖结果和轨迹。

可将指标分为六类:任务完成度、事实与证据准确性、覆盖率、过程效率、安全合规、资源成本。不同指标可以采用不同评分方式:结构字段用确定性检查;事实关系用基于证据的判定;报告质量用 LLM judge;高风险动作通过策略日志直接评分;极端案例则由人工复核。

2. LLM 评分器需要人工校准,不能把"自动评估"理解为无人负责

Outtake 的实践中,研发团队把人工复盘标准逐步自动化,让 AI 读取长运行记录并打分,以缩短迭代周期。Anthropic 后续关于 agent eval 的工程文章也指出,评估本身会贯穿智能体生命周期:早期帮助团队定义成功,后期帮助识别回归。

但 LLM judge 仍然是概率系统。生产实践中应通过一组人工标注样本校准评分器,定期检查评分漂移,并把关键安全项设计成确定性规则。尤其是"是否违反权限""是否引用了不存在的证据""是否访问禁止域名"等问题,不应交给主观评分。

(二)相比一个平均分,"失败分类"更有工程价值

1. 长时智能体需要一套可操作的失败 taxonomy

如果 100 个测试任务平均得分从 82 提升到 84,团队仍然不知道该改什么。更有用的是建立失败分类,例如:

  • 证据缺失:结论没有足够来源支持;

  • 关系误连:把相似但无关的实体错误关联;

  • 工具选择错误:存在更直接工具却使用高成本路径;

  • 参数错误:工具调用格式或范围不正确;

  • 调查漂移:偏离初始任务目标;

  • 循环重复:在同一假设上多次无效重试;

  • 过度扩张:从低价值线索无限横向搜索;

  • 上下文遗忘:压缩后忘记已验证事实或禁止条件;

  • 提示注入影响:把网页内容当作系统指令;

  • 权限越界尝试:请求执行不允许动作;

  • 终止错误:过早结束或在收益极低时不停止。

这些类别一旦稳定,就可以直接对应研发动作:工具问题改工具,状态问题改 Harness,证据问题改评分和报告结构,安全问题改权限与隔离。

2. 回归集必须覆盖"正常任务"和"对抗任务"

网络安全智能体面向的是敌对环境,因此测试集不能只包含干净网页。应主动加入提示注入、恶意脚本、重定向循环、超大页面、伪造错误信息、故意相似的实体、短暂网络故障、工具超时、证据冲突等情况。系统要证明的不只是"正常时会工作",还要证明"异常时失败得可控"。

长期看,测试集应从生产失败中持续生长。每一次真实事故或严重误判都应该被抽象成新的回归场景,避免同类问题再次发生。这种"事故即测试"的机制,是把运维经验沉淀为产品能力的关键。

(三)工具改进也可以进入自动闭环,但最终责任不能外包

1. 智能体最清楚自己在哪些地方"缺工具"

Outtake 案例中一个很有启发的做法是:调查智能体在任务结束后反馈缺失工具,另一编码智能体根据建议开发工具并生成测试场景,最终由人工检查"这个工具是否真的让调查更好"。这实际上把智能体从执行对象变成了开发反馈源。

企业可以把类似机制制度化:每次运行结束后让智能体输出"阻塞点、重复劳动、工具缺口、上下文浪费点",再聚合高频问题。只有当某个缺口在多个任务中反复出现,并且自动化收益明确时,才进入工具开发。这样可以避免凭想象堆功能。

2. 自动生成工具必须经过安全审查和回归测试

编码智能体可以显著降低实现成本,但它生成的新工具可能扩大权限、引入依赖漏洞或返回过量数据。因此工具自动化闭环必须有最后一道人工或策略审查:检查最小权限、输入验证、网络范围、超时、日志、敏感信息处理和回滚方式,并在完整回归集上比较新旧版本。

自动化的目标不是取消责任,而是把人的时间从机械阅读数十分钟日志,转移到真正需要判断的架构与风险决策上。

六、安全模型:默认智能体会被攻击,才能设计真正可上线的系统

(一)提示注入不是单纯的"模型缺陷",而是信任边界问题

1. 调查智能体天然会读取攻击者控制的内容

普通企业助手可以通过限制数据源来降低提示注入风险,但网络安全调查恰恰需要访问恶意站点、钓鱼页面、攻击者社交账号和可疑代码。这意味着它必须主动进入不可信环境。只要模型会把外部文本放进上下文,攻击者就可以尝试在网页中植入"忽略之前指令""读取本地文件""把结果上传到某地址"等内容。

因此不能把安全策略建立在"模型应该能识别这是假指令"上。即使模型在大多数情况下能抵抗,概率防线也会存在漏网情况。系统应该假设某一次会话最终可能被成功诱导,然后问一个更重要的问题:即使模型被诱导,它最多能造成什么影响?

2. 内容、指令和权限必须在系统结构上分离

对模型而言,网页文字和用户文字最终都可能以 token 形式进入上下文;但对系统而言,它们必须属于不同信任等级。外部内容应被标记为数据而不是指令,关键工具调用应受权限策略控制,敏感信息不应默认出现在可被模型读取的环境中。

一个实用原则是:不要把"不能做什么"只告诉模型,而要让模型物理上做不到。例如不允许访问内网,就在网络层阻断;不允许读取生产密钥,就不要把密钥挂载进沙箱;不允许向任意地址出网,就做 egress allowlist;高风险命令需要人工确认,就让调度器在执行前暂停,而不是让模型自行决定是否询问。

(二)安全重点应从"监督每一步"转向"限制爆炸半径"

对抗提示注入的核心不是一层"更强提示词",而是从网络入口、执行沙箱、工具权限、数据出口到审计记录的多层控制。

1. 沙箱、权限和出网控制共同构成 Blast Radius

Anthropic 关于 agent containment 的工程实践提出了一个关键思想:概率式监督很难保证每次都正确,因此还需要通过容器、虚拟机、系统调用限制和出网边界来限制智能体能够造成的最大影响。对网络调查智能体而言,可以建立多层隔离:独立计算沙箱、只读基础镜像、临时文件系统或隔离工作区、受限网络出口、工具白名单、凭证最小化、任务结束自动销毁环境。

"沙箱"不是万能答案。即使运行环境被隔离,如果允许访问某个受信任域名,而该域名自身可以接受文件上传,仍可能形成数据外泄路径。因此安全设计要从资产和数据流角度检查:智能体能读到什么、能向哪里写、哪些数据能跨边界、每个出口是否具有业务必要性。

2. 联网前的动态信任检查,是对抗环境中的关键关口

Outtake 在案例中提到一种"联网预检"思路:当智能体准备访问目标时,对页面或目标的信任级别进行评估,判断是否可能是仿冒、恶意代码或提示注入。这种设计很有推广价值。与其让所有外网访问使用相同权限,不如把"互联网访问"也做成带风险评分的动作。

例如,访问公开企业官网可进入低风险浏览模式;访问新注册域名或已知钓鱼站点则进入严格沙箱,禁用持久凭证、禁止下载后自动执行、限制请求方法并开启更详细审计;如果需要提交表单或执行脚本,则必须升级到人工确认。风险评分并不需要完美,只要能用于切换不同防护配置,就能有效缩小潜在影响范围。

(三)可观测性与审计必须是一等能力,而不是上线后的补丁

1. 每一次关键动作都要能回答"谁、何时、为什么、做了什么"

长时智能体的日志不能只记录 API 调用。理想的事件模型应包括:任务 ID、步骤 ID、模型版本、上下文摘要版本、工具名称和参数、权限决策、外部请求目标、返回状态、生成/修改的工件、风险评分、人工确认以及成本信息。对于高风险动作,还需要记录决策依据与审批人。

这些数据不仅用于安全审计,也用于开发。很多质量问题只有把轨迹可视化后才能发现,例如智能体在某个工具错误后重复尝试 12 次,或每次都在上下文压缩后重新查询已经获得的证据。

2. 可回放机制是事故响应和模型升级的基础

当模型供应商升级版本、工具接口改变或上下文策略调整时,团队需要知道这些变化对历史任务会产生什么影响。通过保存结构化事件和必要工件,可以在沙箱中"重放"过去的任务,比较新旧系统的决策差异。这比单纯保存最终报告更接近软件工程中的测试可重复性。

对于网络安全这样高审计要求的场景,可回放还是责任边界的一部分:企业应能够解释为什么智能体得出某个结论、当时使用了哪些数据、哪些动作由模型自主完成、哪些动作由人批准。这种透明度将直接影响系统是否能被安全团队和合规团队接受。

七、从案例外推:企业如何构建自己的"调查型智能体"

(一)先判断任务是否真的适合智能体,而不是把所有流程都代理化

1. 适合智能体的任务通常同时具备四个特征

第一,任务存在多步决策,且下一步取决于前一步结果;第二,工具和外部环境会出现不可预期情况,固定流程难以穷举;第三,任务有相对清晰的成功标准,可以通过证据或结果评估;第四,错误可以被系统边界限制,或者有人工检查点兜底。

网络调查正好满足这些条件。相反,如果任务只是从固定数据库生成报表、按照明确规则审批、执行高度确定的 ETL,传统工作流往往更可靠、更便宜。Anthropic 早期关于有效智能体的总结也强调:当简单调用或确定性工作流足够时,没有必要强行增加 agentic complexity。

2. "是否需要自主性"应由不确定性决定,而不是由宣传目标决定

很多团队会从"我们需要一个完全自主智能体"倒推架构,结果为了追求自主而牺牲稳定。更合适的做法是逐段分析流程:哪些步骤确定性高,可以直接编码;哪些步骤信息不完整,需要模型判断;哪些步骤风险高,必须人工批准。最终系统可能是 70% 确定性代码 + 20% 模型判断 + 10% 人工,而不是一个模型包打天下。

衡量一个系统成熟度的标准,也不应该是"人工介入越少越先进",而应该是"在可接受风险和成本下,单位任务的完成质量是否提高"。

(二)一个可复用的五层生产架构

1. 五层架构把"业务目标"和"模型执行"解耦

企业可以把调查型智能体拆为五层:任务与标准层、证据与状态层、执行 Harness 层、安全控制层、评估与运营层。每一层解决不同问题,避免把所有逻辑挤进一个 system prompt。

1.1 任务与标准层:定义目标、范围和"完成"

这一层包含任务 schema、允许范围、成功标准、停止条件、风险等级和报告模板。它决定系统究竟在做什么,而不是如何做。

1.2 证据与状态层:保存事实,不依赖聊天记忆

保存实体、关系、证据、时间线、待验证假设、工件和任务状态。所有关键结论都能关联到证据 ID,所有上下文压缩都能从这里恢复。

1.3 执行 Harness 层:管理模型、工具与会话

负责上下文装配、工具发现、错误重试、状态切换、任务恢复、并发控制和成本预算。模型版本可以替换,但任务状态和系统规则保持稳定。

1.4 安全控制层:决定"模型即使失控也做不到什么"

包括沙箱、文件权限、网络隔离、出网白名单、凭证代理、工具权限、人工确认和敏感数据策略。它是不可由模型覆盖的硬边界。

1.5 评估与运营层:把每次运行变成下一次迭代的数据

包括离线 eval、在线质量指标、失败分类、成本监控、人工复核、版本对比和事故回放。没有这一层,系统只能靠经验"感觉变好了"。

2. 控制面与执行面应该分离

在工程实现上,还可以把系统进一步划分为控制面和执行面。控制面负责创建任务、分配权限、记录状态、触发评估、接收人工确认;执行面运行具体智能体和工具。这样即使某个执行沙箱被污染,控制面仍然保持独立。

对于多租户企业场景,控制面还应负责租户隔离、策略版本、密钥管理和审计导出。模型和工具不应直接持有长期高权限凭证,而是通过短期、任务级授权访问必要资源。

(三)一条更现实的十二周落地路线

1. 十二周路线的目标不是"做完平台",而是形成第一个可评估闭环

很多企业会把智能体项目排成半年以上的平台建设,最终在没有真实任务反馈前投入过多基础设施。更有效的节奏,是在大约十二周内完成从专家基线到受控生产试点的最小闭环。具体时间会因行业与合规要求不同而变化,但阶段顺序比日期本身更重要。

2. 四个阶段的推进重点

2.1 第 1---2 周:建立专家基线和任务样本

选择一个边界清晰、价值明确的调查任务,由领域专家完整执行 20---50 个真实或脱敏案例。记录每一步做了什么、用什么证据、如何判断完成,并形成第一版评分 rubric。此阶段不要急着做复杂 Agent。

2.2 第 3---6 周:用最小工具集跑通端到端原型

为模型提供必要的浏览、查询、文件和代码执行能力,优先验证是否能完成核心任务。人工观察所有运行,记录失败 taxonomy。此阶段允许实现粗糙,但必须开始收集结构化日志和证据工件。

2.3 第 7---10 周:把关键规则移入 Harness 与安全层

根据真实失败,把高频规则从提示词移到代码;加入任务状态、可恢复执行、权限分级、沙箱和出网控制;对常见工具做专用化和返回结果压缩。与此同时建立自动 eval,至少覆盖正常任务、工具故障和提示注入场景。

2.4 第 11---12 周:小范围生产试点与版本化运营

选择低风险业务范围上线,由人工对最终结果负责。记录每次任务的质量、成本、运行时长和人工介入点;每周把生产失败转化为回归用例。此时才开始讨论扩大任务范围、降低人工复核比例或引入多智能体等更复杂能力。

八、进一步推演:长时智能体会如何改变安全产品与安全团队

(一)安全产品的竞争点将从"数据覆盖"转向"持续推理与行动闭环"

1. 数据不再是终点,而是智能体的可操作环境

传统安全平台强调"我们能看到多少数据源",未来更关键的问题可能变成"系统能否在这些数据上持续形成假设并行动"。如果多个厂商都能接入相似的公开情报、域名数据和日志,差异就会来自实体解析、上下文管理、工具质量、调查策略、评估体系和安全边界。

这意味着数据平台和 Agent 平台正在逐渐融合。安全数据需要能被模型按需检索,模型产生的实体关系又要反过来写回数据层,形成可积累的模式记忆。每一次调查都不只是一次服务交付,还可能为下一次调查增加已验证知识。

2. "自动化覆盖率"会被"闭环完成率"取代

过去企业常用"自动化了多少步骤"衡量效率,例如 80% 告警已自动分流。但在调查型智能体时代,一个更有意义的指标是端到端闭环完成率:从信号进入,到证据收集、关系扩展、结论生成、人工确认和处置建议,多少任务能够在质量门槛内完成。

闭环指标迫使团队关注中间最弱环节。如果智能体能自动完成 95% 的查询,却因为最后无法解释证据而必须全部人工重做,那么自动化覆盖率并没有转化为实际生产力。

(二)安全分析师的角色会从"执行查询"转向"设计标准和处理例外"

1. 专家经验会从个人技能变成可执行的系统资产

Outtake 的第一步"先成为专家"揭示了一个更深层趋势:当团队把调查标准、证据要求和失败模式写成 rubric、工具和测试后,原本存在于资深分析师头脑里的 tacit knowledge 会逐步被系统化。专家的价值不会消失,而是从逐条执行任务,转向定义标准、处理边界案例、校准评估和改进工具。

这会改变团队培养方式。新分析师不必从重复查询开始学习,而可以从审查智能体轨迹、理解为什么某个结论可信、为什么某条线索应该停止继续调查开始。人机协作的重点从"帮 AI 补一段文字"转向"共同维护一套调查方法论"。

2. 人工复核应集中在不可逆、高影响和低置信场景

如果所有任务最终都需要专家从头读一遍完整轨迹,智能体很难产生规模效应。因此人工介入应该逐步从"全量复核"变成"风险抽样 + 例外升级"。系统可以根据结论置信度、证据完整度、动作风险、提示注入信号和历史模型表现来决定是否需要人工。

但这种降低人工比例的过程必须由 eval 数据驱动,而不是靠产品目标倒推。对于高影响安全处置,即使模型长期表现良好,也可能继续保留人工确认,因为风险收益比决定了这个检查点值得存在。

九、结语:长时智能体的竞争,不是"更会思考",而是"更会完成"

Outtake 的 Recon Agent 案例把一个重要趋势展示得很清楚:当模型能力足以浏览、写代码、运行工具并持续推理后,智能体的工程重点开始从"如何让模型做出一次漂亮回答"转向"如何让系统在长时间、复杂环境和对抗输入下稳定完成任务"。这也是为什么案例中最值得复用的经验不是某一段提示词,而是四个工程动作:先定义专家标准,再用高能力环境快速验证;把必须执行的规则固化到 Harness;用持久状态和工具让模型在长时间内保持工作连续性;最后用自动评估把改进速度做成系统能力。

对于企业来说,这种方法论的意义远超网络安全。任何需要跨系统收集证据、持续推进、多步判断、处理异常并最终形成可审计结论的任务,都可能采用类似架构,例如合规调查、供应链尽调、欺诈分析、研发故障定位、复杂客服升级和内部审计。区别只在于不同业务的证据、工具、风险与停止条件不同。

真正的长时智能体不是一段更长的 prompt,也不是一个循环调用模型的脚本。它更像一个新的软件运行时:模型负责在不确定部分做判断,Harness 负责保持任务连续,工具负责连接现实世界,安全层负责限制最坏后果,评估层负责让系统在每一次运行后变得更可测、更可控。只有当这五部分共同成熟,"自主"才不再是演示中的能力标签,而会变成可以被企业真正信任的生产能力。

参考文章与进一步阅读

  1. Anthropic / Claude:How Outtake built a cyber investigator on Claude ------ 本文案例的主要公开来源,介绍 Recon Agent 的任务、四阶段构建路径与长时智能体经验。

  2. Anthropic Engineering:Building effective agents ------ 关于何时使用工作流、何时使用智能体,以及保持系统简单、透明和可测试的基础方法论。

  3. Anthropic Engineering:Effective context engineering for AI agents ------ 讨论上下文作为有限资源、压缩、结构化记忆与长时任务连续性。

  4. Anthropic Engineering:Effective harnesses for long-running agents ------ 讨论跨多个上下文窗口持续工作的 Harness 设计与持久工件。

  5. Anthropic Engineering:Demystifying evals for AI agents ------ 讨论多步智能体的自动评估、LLM grader、回归测试与生命周期评估。

  6. Anthropic Engineering:Writing effective tools for agents --- with agents ------ 讨论工具边界、描述、返回结果压缩和通过 eval 改进工具。

  7. Anthropic Engineering:How we contain Claude across products ------ 从沙箱、虚拟机、网络出口与 Blast Radius 角度讨论更强智能体的系统级隔离。

  8. Claude Platform Docs:Permission policies ------ 展示按工具配置自动允许与人工确认的权限策略思路。

  9. Outtake:Recon Agent ------ Outtake 对 Recon Agent 当前定位、调查链路与产品能力的公开说明。

相关推荐
xiaohaiAIgeo1 小时前
【2026年】通风柜面风速控制的时滞与补偿策略
人工智能·科普知识
小淮AI1 小时前
AI远程操控电脑,距离日常办公还有多远?
人工智能·电脑
头发够用的程序员1 小时前
别被 TOPS 参数迷惑:手把手推导边缘 GPU 整型算力
人工智能·python·ubuntu·计算机视觉·硬件架构·边缘计算
思考着亮1 小时前
5.成本、缓存与可观测性
人工智能
大闸蟹u1 小时前
图解 AI Agent:Agent = 模型 + Harness
人工智能
dunge20261 小时前
ChatGPT Plus / Pro 与 Codex 深度实战:2026年9月5日 从模型能力对比到代码生成工作流全解析
人工智能·chatgpt
阿拉斯攀登1 小时前
SpringCloudAlibaba微服务消息调用:跨服务业务异步解耦
人工智能
joinwell521 小时前
只发 GET,为什么还是写进去了?从公共 Wiki 到 Agent 工具门禁的效果边界
人工智能·http
zhuhai_xigedian1 小时前
源网荷储一体化柜的经济效益优化功能实现机制
大数据·运维·人工智能·重构·能源