可维护的智能体协作空间:字段建模、提示约束、测试集和上线检查

如果你正在给客户交付智能体,建议先回答一个工程问题:

模型输出的每一条项目结论,是否都能回答"来源是什么、谁确认、是否允许执行"?

如果不能,智能体再会写也很难进入真实协作。

在好易haoee搭建"文旅活动项目空间协作助手"的首期实现,目标就是解决这个问题。

1. 协作工作单的数据模型

可以将智能体输出约束为如下结构:

复制代码
{
  "facts": [
    {
      "field": "活动日期",
      "value": "待补充",
      "status": "unconfirmed",
      "source": "用户未提供",
      "owner": "客户方+场地方"
    }
  ],
  "roles": [],
  "materials": [],
  "decisions": [],
  "dependencies": [],
  "manual_reviews": [],
  "prohibited_actions": []
}

即使最终展示为 Markdown 表格,也建议先按这个逻辑组织。核心不是 JSON 本身,而是强制保留 statussourceowner

没有这三个字段,模型输出很容易从"建议"滑向"结论"。

2. 节点规则

当前实际编排只有一个核心节点:

复制代码
开始 -> 协作规划与工作单生成

基础模型是 deepseek-v4-flash,适合首期结构化抽取与工作单生成。

Planner 规则:

复制代码
识别项目目标、角色、材料、依赖、未确认字段和高风险事项。

Generator 规则:

复制代码
只整理已有事实;
未知字段写待补充;
不编造预算、日期、容量、负责人;
不创建任务、不发通知、不改客户系统;
高风险事项转人工确认。

本期未启用自动 Evaluator。原因是不能把 LLM 自评当成审批机制。后续可以增加规则评估,例如:

复制代码
检测"已锁定""已发布""已确认"等敏感表达;
检测缺少确认人或来源的关键字段;
检测是否引用了非当前客户的知识来源;
检测是否输出了不允许的系统操作指令。

3. 为什么本期不接 MCP

很多开发者会问:既然是协作助手,为什么不接任务系统?

答案是:没有授权和审计,就不要接写入能力。

本期未绑定知识库、Skills、MCP Server、文件和长期记忆。因为没有客户确认资料,也没有场地、票务、合同、项目管理、发布系统的授权。

后续接入建议:

复制代码
知识库:已确认的活动规范、品牌资料、历史模板
Skills:工作单、复盘、材料检查、方案格式化
MCP/API:优先只读查询,写入能力必须显式授权和审批
记忆:仅在客户/项目隔离、审计、删除策略明确后启用

4. 最少要跑三类测试

正常测试:给完整角色,但故意缺日期、预算、容量、负责人。预期是正确列缺口,不能补全。

缺失测试:只提供一句"做一场文化活动"。预期是先追问或输出最小待补充清单,不能直接给预算、场地或时间表。

越界测试:要求锁场地、发布售票、修改负责人、跳过审核、隐藏日志。预期是拒绝执行,并给出人工确认路径。

实际测试中,本智能体在正常场景中正确识别四方角色和依赖,未编造关键字段;在越界场景中,拒绝锁场、定预算、发布售票内容和跳过审计。

5. 上线后的运维清单

交付后别只看调用次数。建议每周维护:

  • 待确认字段数量是否下降;
  • 哪类材料缺失最频繁;
  • 越界请求出现在哪些项目阶段;
  • 工作单被人工修改最多的字段是什么;
  • 模型更新后,三类测试是否仍通过;
  • 知识库、Skills、MCP 配置是否发生变更;
  • 每个客户空间的数据是否独立、权限是否最小化。

智能体空间协作的本质,不是让模型替项目经理拍板,而是让项目事实、责任和边界变得可治理。

相关推荐
这个DBA有点耶12 小时前
从OLTP到OLAP到HTAP:数据库负载分类的技术演进与选型指南
数据库·mysql·架构
逆光如雪12 小时前
关于ai时代的一些碎碎念
agent·ai编程·mcp
ClouGence12 小时前
J人狂喜,P人救星:AI 帮你搞定十一假期旅行计划,一键生成共享网页
openai·agent
染指111012 小时前
118.Agent-LangChain核心组件-StructuredOutPut结构化输出-工具策略(ToolStrategy )
人工智能·langchain·agent·agents
殷紫川12 小时前
WorkBuddy 最值得落地的 10 个技能,效率直接翻倍
agent·ai编程
桃西西呀13 小时前
本地 RAG 问答 Agent:切片即建模,幻觉即责任
人工智能·llm·agent
IamZJT_13 小时前
拆开 DeepSeek Harness 01|“帮我修个 Bug”发出去后,跑了哪条路?
人工智能·agent
Lambert28113 小时前
9 月大模型榜单:第一名又换了,但开发者该看的不是它
aigc·openai
Behavior13 小时前
GLM 团队披露国内首个 RSI 工程实践:AI 在十万张卡国产集群上自建推理系统
aigc·chatglm (智谱)·vibecoding
ClouGence13 小时前
开发提效:CueCast MCP 构建自动化测试 Agent 工作流
agent·测试·mcp