1. 背景
生成式人工智能服务备案(大模型备案)的材料清单里,有三份被业内称为"内容安全三件套":语料标注规则、关键词拦截列表、评估测试题集。它们是备案材料中工程属性最强的部分,也是逻辑上环环相扣的一组。本文记录这三件套的设计要点与踩坑经验。
2. 语料标注规则:不是写制度,是写可执行的流程
语料标注规则要回答四个问题:标注什么(违法不良信息的类目定义与分级)、谁来标(人员资质与培训)、怎么质检(抽检比例与双标一致性)、怎么纠错(异议处理与回滚)。
工程要点:
- 类目定义要能对齐 GB/T 45654 的安全类目,并映射到关键词列表和题集的安全维度;
- 抽检比例要写实。写"100%全检"反而不可信,标注质量要靠抽样统计说话;
- 规则里要体现对标注人员的安全保障(如轮岗、心理疏导),这是容易被忽略的合规项。
3. 关键词拦截列表:分层的敏感词库
拦截列表不是一张平面的词表,建议按三层设计:
第一层,绝对拦截词:涉政、暴恐、涉黄等高危类目,命中即拦截,无白名单豁免;
第二层,条件拦截词:需要结合上下文判断的词(如部分医学术语),配合语境模型二次判定;
第三层,白名单:新闻、科普、教育等正当场景的豁免词,避免误杀正常内容。
工程要点:
- 词表要有版本管理和更新机制,监管通报的新话术、变体(拼音、谐音、拆字)要能快速入库;
- 词表的补齐方向由评估结果驱动:内部测试暴露哪类内容漏过,词表就优先补哪个类目,不追求大而全。
4. 评估测试题集:配比、变体与证据链
题集的三类结构(应拒答、边界、普通)在业内已有共识,这里不再展开定义,重点讲三个最影响通过率的工程细节:
- 变体设计:应拒答题的每个风险点至少配四种问法------直问、语境化包装、角色扮演设定、多轮诱导,覆盖监管抽测常用的改写手法;
- 配比依据:安全类题目的占比参照内部红队测试中实际暴露的问题分布设定,而不是拍一个"看起来安全"的比例;
- 证据留存:每道题保留完整的原始问答记录(含模型原始输出),按类目归档。补正答复时,评审最常要的就是这部分证据。
边界题的分寸线可以记成三句话:不下定论、点明风险、引导专业咨询。
5. 收益总结
三件套的本质是用工程证据证明安全能力。评审看的不是文采,是逻辑一致性:标注规则定义的风险,词表要拦得住,题集要测得出,评估报告要讲得通。启动备案前先做一轮三件套的对齐评审,能显著减少补正轮次。
参考资料:
- GB/T 45654《网络安全技术 生成式人工智能服务安全基本要求》
- 《生成式人工智能服务管理暂行办法》
- TC260 全国网络安全标准化技术委员会相关技术文件