最隐蔽的隔离漏洞不是数据跑错了地方,是一个进程的退出方式影响了所有人。
这轮巡检里有一个问题让我停下来想了很久:停止某一个租户的通讯进程,导致其他所有租户的连接同时断掉。
一、进程信号的继承边界
根因是子进程从父进程继承了信号处理逻辑。系统想结束一个租户的子进程,发出终止信号,但这个信号沿着继承关系向外扩散,打到了同一组里其他人的进程上。
数据隔离、权限隔离、存储隔离,大家都知道该做。进程信号的继承边界,很少有人在架构设计时会想到。修法是让每个子进程在启动时主动重置信号处理器,不继承父进程的行为。一行处理,影响面是全租户。

二、上下文预算被压到3.2%
第二轮巡检碰到了一个渐进式的问题。任务执行过程中会产生大量事件,当事件量超过阈值,系统整帧丢弃这批数据。连续几次丢弃后,可用上下文预算被压缩到原来的3.2%。
3.2%意味着AI在执行任务时几乎没有工作空间。它不会崩,任务仍然标记为进行中,但思考质量已经在这个极度压缩的状态里悄悄下滑------没有报错,没有告警,只是越来越"记不住东西"。
这种隐性降级比直接崩溃更难发现。你不会立刻知道出了什么问题,只会觉得系统今天"发挥得不太好"。

三、Google Workspace连接器全链路上线
这轮最重的新功能是Google Workspace连接器,从接入、授权向导、数据库契约、路由转发到前端测试用例,完整链路打通。
做连接器最麻烦的不是API调用,而是授权流程的每一步都需要在产品层做出判断:什么时候引导用户、错误状态怎么展示、授权失败如何恢复。这些判断散落在前后端和数据契约之间,任何一环不对齐,用户体验就会在中途碎掉。
同一轮,系统接管能力也完成了收口------目录技能、按稳定标识删除、非法标识的错误处理、探索任务处理器部署,逐项落地。

四、基础设施的钉版
这轮做了一件基础但重要的事:把后端、沙箱、前端的基础镜像全部钉住了版本,不再跟随上游浮动。
浮动依赖的问题在于平时不报错。等上游某个版本有破坏性变更,你的构建会在某天突然失败,而那个变更和你的代码改动没有任何关系,排查起来极其费时。钉版之后,镜像构建行为变成可预期的------你知道它在用什么,出问题时也知道去哪里查。
稳定不靠运气,靠把不确定性逐一消除。

五、越狱检测扩规模
越狱和注入防护这轮扩充了中文变体的检测规则。这是一个不断追赶的过程------攻击方式会随模型迭代演化,防护规则需要同步更新。真正的攻击不会直接翻译英文越狱提示,而是用更贴近语言习惯的方式来绕。这轮重点补的就是这一块。

从Google连接器上线、系统接管收口,到三轮巡检止血、上下文预算修复、基础镜像钉版,这24小时的迭代密度相当高。
大部分时候不是打仗,是在没有报错的地方找到出了问题的东西,在它变成事故之前修掉。
这,是第七十七天。
**《从0到1:企业级AI项目迭代日记》**记录一个企业级 AI 项目从创意、架构到落地的真实过程。不讲神话,只记录进化。
如果你也在做企业 AI 落地,欢迎留言来聊。或者,把这篇转发给一个正在踩同样坑的朋友。