NER 是 Named Entity Recognition 的缩写,中文叫命名实体识别。它是自然语言处理(NLP)中的一项基础核心技术。
用一句话概括:它就像一台"智能扫描仪",能从一段非结构化的文字中,自动识别出我们关心的"人名、地名、时间、数字"等关键要素,并给它们贴上分类标签。
🎯 它具体做什么?
给你一个直观的例子,当输入这句话时:
"苹果公司CEO蒂姆·库克在6月10日于北京宣布了新款iPad的售价为599美元。"
NER系统会自动识别出:
- 苹果公司 →
[组织] - 蒂姆·库克 →
[人名] - 6月10日 →
[日期] - 北京 →
[地点] - 599美元 →
[金额]
这样一来,杂乱无章的文本就被结构化了。
🤔 为什么在"输出脱敏"方案中特别提到它?
在AI输出脱敏场景中,正则表达式 是"硬规则"(比如匹配手机号11位数字),但它不够聪明,容易误伤或遗漏。而 NER 是"语义识别",它的优势在于:
- 能识别变种 :哪怕用户说"我下周一去协和看病",正则表达式很难抓取,但NER能准确识别出"协和"是
[医疗机构]。 - 能理解上下文:比如"苹果"在"我爱吃苹果"里是食物,在"苹果公司发布新机"里是组织,NER会结合语境判断,不会一刀切。
- 处理非结构化数据:AI生成的文本千变万化,NER能动态提取出隐含的身份证号、家庭住址、社保卡号等敏感实体,方便后续对其进行替换或遮蔽处理。
⚙️ 它通常怎么实现?
现在的NER主要靠深度学习模型(如BERT、LSTM+CRF)来实现。不过,在AI安全脱敏的具体工程落地中,为了兼顾速度和成本,通常会采用**"规则优先 + 模型兜底"**的策略:
- 简单的固定格式(如身份证号)先用正则表达式秒过。
- 复杂的、语义模糊的内容(如医院名称、非标准职位)再交给NER模型来精准识别。
简单来说,在AI安全体系里,NER就是负责给文字中的"敏感信息"精准定位的"侦察兵",定位准了,后续的脱敏才能"打靶"打得稳。