先在"可能世界"中测试自治系统:PEIRAVELA 的实验控制平面
当 Agent、工作流、机器人或安全控制开始影响真实业务时,团队需要在上线前回答一个问题:
如果环境发生变化,系统会做什么?
传统测试通常验证预先定义的输入和输出,但自治系统会受到上下文、资源、时序、外部系统和策略变化的共同影响。只在单一环境中运行一次,很难发现系统在异常条件、边界条件和反事实条件下的行为。
PEIRAVELA 将自己定义为 possible-world experiment control plane,即"可能世界实验控制平面"。它负责创建受治理的实验世界,运行场景和反事实分支,注入可控扰动,并生成来源完整的原始仿真证据。
一个典型的实验闭环包括:
创建世界
→ 派生分支
→ 执行场景
→ 观察结果
→ 比较控制变量
→ 销毁环境
→ 验证证据
→ 必要时重放
其中,"世界"不是一个随意启动的测试环境,而是具有明确生命周期的隔离对象。每一次执行都与场景、扰动、控制变量和随机种子绑定,使不同运行之间能够被区分和比较。
PEIRAVELA 支持 scenario × perturbation × control × seed 的实验矩阵。团队可以保持场景和随机种子不变,只改变某个治理策略、模型版本或资源限制,从而观察变化究竟由哪个因素引起。
平台还记录真实的运行事实,包括:
- 场景和控制配置摘要;
- 随机种子与时钟;
- 内存、CPU 和运行时间;
- 观察器健康状态;
- 环境清理结果;
- 仿真到现实的校准和保真度信息;
- 缺失信息的显式声明。
但 PEIRAVELA 刻意保留了一条重要边界:
它是原始证据生产者,而不是最终裁判。
平台记录发生了什么,却不自行宣称测试通过、系统可信或允许发布。Pass/Fail、Assurance Claim 和 Release Gate 由外部评估或工程保障系统负责。这种分工避免实验平台既生成数据、又解释数据、最后再批准自己的结论。
为了减少平台自证带来的信任问题,PEIRAVELA 的证据包可以由第三方独立验证。公开仓库提供仅依赖 tar 和 SHA-256 的验证方式,外部评估者不需要安装或信任 PEIRAVELA 自身工具,就可以核对证据包的内容和摘要。
在执行层面,平台不仅模拟数字结果,还可以测量真实进程的 CPU 和内存,运行受限的本地进程,并在 Linux 容器中使用默认拒绝网络访问和 cgroup 资源限制。这让实验环境能够逐步从逻辑仿真过渡到真实受控执行。
PEIRAVELA 的架构价值在于把三类责任分开:
- 仿真系统负责创造和控制世界;
- 证据系统负责忠实记录观察结果;
- 评估系统负责基于证据作出判断。
这一区分对 Agent、数字孪生、机器人和安全系统都很重要。一个可靠的实验平台不应该替团队保证未来,而应该让团队能够清楚知道:运行的是哪个世界,改变了什么条件,观察到了什么,以及这些结果能否被独立验证。