最近这些年,国内针对AI安全的治理规则一直在持续更新和完善,专门针对大模型训练数据的相关规范,也变得越来越细致。在早些年,大部分企业在开发大模型的时候,基本都只看重数据的数量和模型最终的使用效果,不太会主动关注数据来源、数据授权、个人隐私保护以及版权这类合规问题。随着行业的监管标准慢慢发生变化,相关的管控工作不再只盯着大模型生成的内容,训练所用的原始数据,开始成为监管规范的重点。现在企业做大模型研发和上线运营,都必须提前做好数据方面的合规工作。本文就结合目前公开的行业治理相关规则,简单整理了大模型训练数据的合规要点,以及企业可以参考落地的应对方法。
一、治理方向变化:训练数据监管从"事后关注"走向"源头规范"
在过去的行业监管工作中,相关部门大多只会管控大模型输出内容的安全问题。从目前最新公开的治理要求能够看出,监管的覆盖范围已经往前延伸了,大模型训练所使用的数据集,变成了现阶段重点规范的内容,整体的变化主要体现在三个方面。
第一,数据溯源的相关要求变得更加明确。企业在使用数据训练模型时,需要清晰记录下数据的来源、获取方式、授权使用范围以及采集时间等基础信息。凡是来源无法核实、相关信息不清晰的数据,都不适合拿来开展模型训练工作。
第二,个人信息的保护标准变得更加严格。如果训练数据当中包含了普通用户的个人信息,企业就必须按照相关规范,做好用户告知、数据脱敏等基础工作。仅仅依靠平台通用的用户协议,已经达不到当下的合规标准了。
第三,数据版权问题被纳入到安全管控的范围之内。网络上公开的文字、图片、音视频等各类内容,都受到著作权的保护,企业在把这些内容用于模型训练之前,一定要核实对应的使用授权。企业需要区分开没有版权的公共内容、已经获得授权的内容以及可合理使用的内容,不能直接批量抓取网络上的版权素材来训练模型。
综合来看,整个行业已经有了统一的认知,训练数据是否合规,直接关系到大模型能不能安全稳定地投入使用,数据安全是大模型稳定运行的基础条件。

大模型训练数据合规新变化图
二、企业开展大模型训练数据工作的常见合规关注点
很多企业在大模型数据合规方面出现各类问题,并不是因为相关技术操作有难度,主要还是企业内部的合规流程不够完善,日常工作里存在很多细节漏洞,比较常见的问题主要有五类。
第一,随意抓取网络上的公开数据。不少研发工作人员都觉得,网络上可以公开浏览的内容,就能够直接抓取过来训练模型。但实际情况是,内容可以公开浏览,并不代表可以随便商用、用于AI模型训练,这种操作本身存在不小的版权风险。
第二,个人信息脱敏工作做得不够到位。部分企业在处理用户数据的时候,只是简单删除了姓名、手机号这类显眼的信息,却保留了身份证片段、地理位置、生物特征等隐私内容。这些没有彻底处理干净的数据,依然会引发个人信息合规相关的问题。
第三,数据授权的完整链条存在缺失。企业向第三方采购数据集的时候,往往没有仔细核查上游数据的授权资质。如果上游的数据本身就存在合规问题,那么采购并使用这些数据的企业,也需要承担相应的风险。
第四,缺少完整的合规评估记录。企业在开展模型训练前后,基本不会针对数据集做专门的风险评估,也不会留存相关的工作记录。一旦后续遇到合规核查工作,企业就拿不出有效的材料,证明自身的合规工作落实情况。
第五,数据存储和清理的相关机制不够规范。在模型训练工作完成之后,企业没有及时清理闲置的原始训练数据,大量的数据集随意存储,没有统一管理,这就进一步增加了数据安全的隐患。
三、企业落地实操方案,分阶段落实训练数据合规工作
阶段1:数据集入库前------源头审核,做好准入把关
企业在采集和引入训练数据之前,需要先做好基础的审核工作。首先要对数据类型进行划分,优先选用公共领域数据、已经正式授权的数据以及合规采集的数据,直接排除掉来源不明、资质不全的数据。其次,对于包含个人信息的数据,要全面完成隐私识别和脱敏处理,根据实际情况补充对应的用户授权流程。与此同时,要核查所有图文、音视频素材的版权授权协议,确认授权范围包含AI训练的用途,规避协议里的各类限制条款。最后,统一整理并妥善保存数据采购合同、授权文件、资质证明等所有相关凭证,方便后续的核查和追溯工作。
阶段2:数据预处理与训练阶段------过程管控,风险隔离
数据正式投入使用之后,企业需要做好全过程的管控工作。首先要搭建完整的数据集台账,详细记录数据版本、使用用途、数据总量、风险等级和负责人员等信息,保证数据全流程可以追溯。有基础条件的企业,可以利用哈希算法核对数据的完整性,用来对比不同的数据版本。其次,结合系统规则和人工复核两种方式,筛选并过滤掉违规、不良、虚假的数据,避免模型学习到错误、有害的内容。最后,严格管控数据的访问权限,按照最小使用权限的原则执行,防止企业内部出现数据泄露的情况。
阶段3:训练完成与上线阶段------评估+持续运维
模型训练工作结束、准备上线使用之前,企业需要完成最后的合规收尾工作。针对训练数据集开展专项的合规评估,把评估结果纳入大模型安全评估体系当中,形成完整的书面评估报告。及时清理不再使用的原始训练数据,按照规范完成数据销毁操作,并且留存好对应的操作记录。同时建立常态化的巡检机制,根据行业治理规则和相关法规的更新变化,定期排查数据集的合规情况,及时调整企业内部的管理制度和数据使用规范。
四、不同类型企业的差异化建议
经营模式不同的企业,在大模型数据合规工作的落实重点上也存在一定差异。自主研发大模型的企业,需要落实的合规工作范围更广、整体要求也更高。这类企业可以组建由法务、技术人员、数据安全人员构成的工作小组,把合规相关要求融入数据采集、清洗、训练的全部流程,在项目刚开始立项的时候就开展合规排查,避免后期补做流程,留下各类安全隐患。
需要采购第三方模型和数据集的中小企业,不能想当然认为外部提供的数据完全合规。企业需要在采购合同当中,明确写明数据合法合规的相关承诺,约定好出现数据纠纷后的责任划分方式,同时保留企业自主核查数据资质的权利。
只在企业内部使用模型、不对外提供相关服务的企业,同样需要遵守数据安全和个人信息保护的相关规定。内部使用的场景,并不能免除企业的合规责任,尤其是使用员工、客户的数据训练模型时,更要认真做好合规管控工作。
五、总结
AI安全治理相关规则的持续更新,主要目的是规范行业粗放的发展模式,改变过去行业只看重模型性能、忽视数据合规的不良现状。大模型训练数据合规不是一次就能完成的工作,需要贯穿模型研发、使用、运维的整个生命周期。
对于企业而言,落实数据合规工作,会增加数据筛选、内容审核、台账管理等基础工作的成本。但是从长期发展的角度来看,完善的合规体系能够有效降低版权纠纷、隐私违规等各类风险,也是大模型产品能够稳定商业化运营的重要基础。未来,只有认真做好数据溯源、版权管控、隐私保护的企业,才能在AI行业中稳定、长久地发展下去。
免责声明:本文仅为AI安全治理政策方向的科普解读,不构成法律意见。企业开展合规落地工作时,应当结合自身业务场景,咨询专业法律人士。文中提及的治理框架相关内容均基于公开可查信息整理,具体规范以官方正式发布文件为准。