背景
很多团队的内容安全流程是这样的:上线前人工测一轮,上线后出事再补。在模型频繁迭代的节奏下,这个模式有两个硬伤:人工测试覆盖不住每次变更;安全策略的执行依赖个人自觉。我们实践的方案是把内容安全检测做成CI流水线的强制卡点。
设计目标
- 每次模型/策略变更自动触发安全评测
- 不达标变更无法进入发布环节
- 全程留痕,评估记录可直接用于备案材料
实现
流水线核心是一个评测Stage,伪代码:

几个工程细节:
- 分级题集:模型变更跑全量,策略变更跑回归集,控制流水线时长
- 判定阈值双轨:硬性类别零容忍,灰色类别按比例设阈值
- 疑似项自动建单:判定为"疑似"的case直接生成人工复审工单,复审结论回写题库标注
踩过的坑
其一,评测耗时 initially 拖垮了流水线------后来用例并发+结果缓存(未变更类别跳过重测)解决。其二,阈值定太紧导致正常迭代频繁被卡------阈值需要和业务方一起校准,并保留Owner人工放行通道(放行动作也留痕)。
收益
上线这套卡点后:安全评测从"每次上线前的手工仪式"变成"每次合并的自动产物";监管沟通需要的评估记录从零散截图变成可导出的结构化档案;两次线上内容风险都在流水线阶段被拦下,没有流出。
结语
内容安全不是上线前的一个动作,而是研发流程里的一类测试。用工程手段把它固化下来,合规成本会随迭代次数摊薄,而不是累积。
参考资料:
- 《生成式人工智能服务管理暂行办法》
- 《生成式人工智能服务安全基本要求》(GB/T 45654)