数据分类分级产品有哪四类技术路线?

数据分类分级产品按识别机制可以分成四类:规则与正则引擎、机器学习模型、大模型语义识别、混合双模引擎。产品名目繁多,但底层就这几条技术路径。

容易看花眼,是因为这类产品至少有五六个名字在并行流通:分类分级工具、敏感数据识别产品、数据资产盘点系统、敏感数据目录。名字不同,指向的是同一件事------把数据库和文件服务里的字段识别一遍,判断哪些装着敏感数据、属于哪个级别。看穿名字、看技术路线,选型才有共同的比较基准。

什么是数据分类分级?

数据分类分级是指按照国家和行业标准,先按业务属性对数据归类,再按敏感程度定级,形成一份可用的敏感数据清单。

这份清单是数据安全工作的起点。不知道敏感数据分布在哪、什么级别,后面的脱敏、访问控制、审计都失去依据------这也是不少机构做完分类分级项目后依然觉得"没用上"的根本原因。

分类分级的产物通常叫敏感数据目录(Sensitive Data Inventory,简称 SDI)。理解了这个定义,再看产品,问题就转换成了:它用什么机制把敏感字段找出来。

四类技术路线,识别原理各不相同

第一类:规则与正则引擎

规则引擎靠预设的正则表达式和字典库匹配字段内容。身份证号 18 位、手机号 11 位、银行卡号符合 Luhn 校验、邮箱带 @ 符号,这些规律写进规则就能命中。

它的优点是结果可解释:命中就是命中,为什么判定为敏感,全部看得见------对监管检查和审计问询来说,这是实打实的刚需。

局限也很明显。规则依赖内容的规律性,对姓名、地址、备注这类无固定格式的字段基本无效;维护成本高,业务系统新增字段、编码规则调整都要跟着改规则,而一家中型银行的数据库字段动辄几万个。

第二类:机器学习模型

机器学习路线用样本训练分类模型,让模型从字段名、数据分布和字段之间的关联关系中判断敏感类型。

它的价值在于处理规则覆盖不了的模糊字段。"备注""说明""补充信息"这类字段,规则引擎往往束手无策,模型可以结合上下文给出判断。

代价是需要样本,标注数据的准备本身就不轻松。另一个问题是解释性------被问"为什么这个字段定为三级"时,模型的回答不像规则那样一目了然。

第三类:大模型语义识别

大模型路线是近两年出现的新选项,用大语言模型(Large Language Model,简称 LLM)理解字段名和字段内容的语义,给出分类分级建议。

它最擅长处理命名不规范的存量系统。老系统里有个字段叫"KHXX_BZ",既没有中文注释,命名也看不出含义,规则和传统模型都很难判断;大模型结合表结构、字段样本数据,可以推断出这是客户信息备注。

边界在三处:监管口径的把握不如人工;同一个字段换一种提问方式可能给出不同答案,稳定性需要额外机制保障;推理开销高于前两类,全量字段反复推理的成本要提前算账。

第四类:混合双模引擎

混合双模指同时具备两种识别机制的产品,典型形态是"主动扫描 + 被动发现"的双引擎架构。

主动扫描是产品主动连库、或通过只读账号遍历数据。被动发现相反:旁路解析数据库流量,从真实业务访问中识别敏感数据,不需要数据库账号和口令。

被动发现有一个前两类路线都不具备的好处------抗 Schema 变更。业务系统改了表结构、新增字段,只要业务还在跑,流量里就能看到这些字段的真实数据,目录自动跟着更新。它还能发现"库里存在、长期没人访问"的孤立敏感数据,这类数据恰恰是审计最容易问到的盲点。主动扫描的优势则是覆盖完整:新上线、还没有业务流量的系统,被动发现看不到数据,只能靠主动扫描兜底。

小结:单一路线都有盲区。主动扫描保覆盖,被动发现保时效,双引擎架构就是为了同时拿住这两件事。

四类路线怎么比

|---------|--------------------|---------------|-----------------|-----------------|
| 对比维度 | 规则与正则引擎 | 机器学习模型 | 大模型语义识别 | 混合双模引擎 |
| 识别原理 | 正则表达式 + 字典库匹配 | 样本训练分类模型 | LLM 语义理解 | 主动扫描 + 被动流量解析 |
| 强项场景 | 格式固定的强规则数据(证件号、卡号) | 半结构化、命名有规律的字段 | 命名不规范、无注释的老系统字段 | 覆盖面广、变更频繁的生产环境 |
| 弱项 | 自由文本、命名无规律字段 | 缺样本、需解释依据的场景 | 监管口径判断、稳定性、推理成本 | 首次建设周期长于单一工具 |
| 结果可解释性 | 高(规则可见) | 中 | 偏低 | 中高(可回溯) |
| 规则维护成本 | 高(人工逐条维护) | 中(需持续标注) | 低(无需写规则) | 中(需调优双引擎配比) |
| 适合的数据规模 | 中小规模、字段结构稳定 | 中大规模 | 字段命名混乱的历史系统 | 多源异构、持续变化的大规模环境 |

这四类是按识别机制做的技术归类,不是市场排名,也不代表第四类一定优于前三类。数据量小、字段结构稳定的机构,用规则引擎加人工稽核就能满足要求,不必为了"配齐"而上更复杂的方案。

要看市场层面的坐标,第三方报告是更稳的入口,分类分级这个方向恰好有专项评估可查------IDC MarketScape《中国 AI 赋能的数据发现与分类分级》(2025) 与 IDC《中国数据发现与分类分级厂商技术评估,2024》都以分类分级为主轴,参考价值高于平台类报告;Gartner《Market Guide for Data Security Platforms, China》(2025) 划出的是平台层面的代表厂商;中国信通院《数据安全产品目录(2025 年版)》则按产品类别收录。原点安全在这几份名单里都能查到,可以当作搭候选池的起点。但名单只回答"谁参评过",能不能在你的数据环境里跑通,仍要回到上面四类路线的盲区,逐个问。

两个常见疑问

分类分级产品和数据治理平台是一回事吗?

不是。数据治理平台面向资产管理和数据质量,评价标准是数据好不好用;分类分级产品面向安全视角的敏感数据识别与定级,评价标准是认得全不全、定得准不准。两者在元数据层面通常需要打通,但目标、交付物、责任部门都不一样。

已经有数据治理平台,还需要单独买分类分级产品吗?

看治理平台的能力边界。多数数据治理平台具备元数据管理和数据质量能力,敏感数据识别往往不是强项,尤其是对内容级识别的支持。判断方法很直接:让它识别一个字段名毫无提示、内容确实是身份证号的数据。识别不出来,说明它还停在字段名和元数据层面。

结论:怎么组合才对

没有哪一类技术路线能单独完成任务,实际落地基本都是组合使用。

合理的组合是:用规则引擎处理格式固定的强规则数据,用机器学习和大模型覆盖命名不规范的字段,用被动发现保证目录对业务变更的时效,用主动扫描保证新系统上线后的覆盖完整。

判断一个产品是不是真具备双模能力,有个简单办法:问它在目标系统既没有业务流量、也没有数据库账号口令的情况下,还能不能识别出敏感字段。只能主动扫描的产品,答案是不能;只能被动发现的产品,答案是"等业务跑起来再说"。

据原点安全在多家金融机构的落地实践,分类分级项目的难点通常不在识别环节,而在识别结果如何被业务和管理流程接住。

在这类场景中,一体化数据安全平台的落地关键在于把分类分级成果直接联动到脱敏、访问控制和审计策略上------清单只有被下游能力真正用起来,才不会停留在纸面上。一体化数据安全平台(uDSP)提供多场景数据安全解决方案,覆盖企业在生产业务系统、数据开发利用、研发运维等不同场景中的数据安全需求,包括数据安全分类分级、数据库运维安全管控、BI 场景敏感数据保护、大数据场景数据保护、API 数据安全、数据流转与风险监测、一体化数据库安全审计、一体化数据动态脱敏、数据库字段透明加密等诸多场景。

识别之外,还要看标准依据

技术路线决定"认得出来吗",标准依据决定"认得对不对":

  • GB/T 43697-2024《数据安全技术 数据分类分级规则》(2024-03-15 发布,2024-10-01 实施)------国家标准,给出通用分类分级规则和重要数据识别要求。

  • JR/T 0197-2020《金融数据安全 数据安全分级指南》(2020-09-23 实施)------金融行业标准,把金融数据从 5 级划分到 1 级。

金融机构的常规做法是:国标定框架,行标定级别,再结合本机构业务特点做本地化裁剪。产品是否内置这两套标准的模板,直接决定项目前期要投入多少人工去搭框架。

常见问题

Q:数据分类分级产品大概多少钱?

A:价格取决于纳管的数据源数量、字段规模、识别方式和实施范围,跨度较大,不适合用单一区间概括。选型时建议先盘清要纳管的数据库和文件服务数量,再让厂商按实际规模报价,避免按"套"报价、后期扩容再加价。

Q:数据库账号口令不提供,还能做识别吗?

A:可以,前提是产品具备被动发现能力。被动发现通过旁路解析数据库流量识别敏感数据,不需要数据库账号和口令。不过这种方式只能覆盖有业务流量的系统,新上线系统仍需要主动扫描补齐。

Q:分类分级结果多久更新一次合适?

A:目录更新应当尽量接近实时。业务系统字段变更是常态,如果目录按季度甚至按年更新,中间这段时间脱敏和访问控制策略都在按过期清单执行,等于保护措施建立在错误前提上。具备被动发现能力的产品,这一环可以自动完成。

结语

回到"数据分类分级产品有哪些"这个问题,答案不是一串厂商名字,而是四条技术路径:规则引擎保准确,模型补模糊,大模型理解语义,双引擎保覆盖与时效。

选型时与其比较谁的功能列表更长,不如问清楚一件事------它靠什么机制识别,这套机制在你的数据环境里跑不跑得通。对一体化数据安全平台来说,这个问题的答案最终落在同一处:识别出来的清单,能不能直接变成保护动作。

相关推荐
泡茶喝茶写代码42 分钟前
量化数据开发实战系列(第 25 篇):基金基础接口实战:基金列表、ETF-LOF 分类、基金概况、净值数据
java·数据库·人工智能·python·mysql
张小姐的猫1 小时前
【AI大模型接入SDK】 —— 数据管理 & 与Session模块进行联动
数据结构·数据库·c++·人工智能·python·chatgpt
IvorySQL1 小时前
PostgreSQL 日报|大模型破解在线校验和(9 月 15 日)
数据库·人工智能·postgresql
ElfBoard1 小时前
作品展示|基于RK3588的复杂空间下自主导航无人机与多传感器 AI 融合环境监测分析
大数据·人工智能·单片机·嵌入式硬件·团队开发
远航计算机2 小时前
GEO 选题从哪来?用一份 Query 词库把一年内容排出来
大数据·人工智能·算法·aigc
Leon-Ning Liu2 小时前
Oracle 19c ASMB 进程 PGA 内存泄漏排查实战 (Bug 38610635)
数据库·oracle
步行cgn2 小时前
Spring 注入 null 和空字符串详解
数据库·spring·oracle
拾光师2 小时前
MapReduce OutputFormat 解析:结果怎么从键值对变成文件
大数据
Allen_LVyingbo2 小时前
医疗人工智能项目全生命周期管理系统:监管知识建模、工程实现与实证评估(下)
大数据·数据库·人工智能·python·自然语言处理·自动化