4.1 分类:给文本贴标签
二分类从两个标签中选一个,例如垃圾邮件与正常邮件;多分类从多个互斥标签中选一个;多标签分类允许同时选多个标签。留言"电梯坏了,而且物业一直不处理"可能既是报修又是投诉,是否允许两个标签取决于业务规则。
不要让模型替你决定标签体系。先定义每个标签的边界、冲突优先级以及"其他"类别,标注人员才能一致。若同类留言总被不同人标成不同类别,提高模型规模通常无法根治问题。
4.2 序列标注和实体识别
命名实体识别(NER)定位文本中的实体片段并分类,例如地点、组织、日期。BIO标注用B表示实体起点、I表示实体内部、O表示非实体。它不只是判断"有没有地点",还要指出地点在原文哪个范围。
"3号楼电梯故障"可按字符展示为:3/B-LOC,号/I-LOC,楼/I-LOC,电/O,梯/O,故/O,障/O。这里"3号楼"被定义为地点;实际项目也可以把楼栋作为单独类型,关键是标注规范前后一致。
4.3 关系抽取和事件抽取
关系抽取连接实体,例如"王工负责3号楼"可得到"负责(王工,3号楼)"。事件抽取组织一次发生的事情,包括事件类型、参与方、地点、时间和状态。它比简单关键词搜索更接近业务记录。
"昨日已修复,今日再次故障"至少包含两次不同状态变化,不能合并成一个不带时间的"故障"。事件记录应保留来源、原文跨度和时间依据,方便人工复核。
4.4 检索、匹配和排序
检索在大量文档中寻找相关内容;语义匹配判断两段表达是否接近;排序把候选内容按相关性排列。用户问"怎么报修",相关文档可能写的是"设施故障申报流程",字面并不相同。
但语义相近不等于可以互换。"允许夜间施工"和"禁止夜间施工"涉及同一主题,向量距离可能很近,业务意义却相反。因此检索负责找候选证据,不能直接代替事实和逻辑判断。
4.5 生成类任务
翻译要求跨语言保留意义;摘要要求压缩内容并保留关键事实;改写强调风格或表达变化;问答要求回应具体问题。抽取式摘要选择原文片段,生成式摘要重新组织表达,后者更灵活,也更容易引入原文没有的内容。
对于制度问答,"回答自然"不是唯一目标。还要检查引用是否支持结论、适用条件是否保留、是否区分旧版与新版、无资料时是否拒答。流畅但错误的回复可能比明确的"暂时无法确定"更有害。
4.6 一张任务选择表
表 2 4.6 一张任务选择表
|--------|----------|-----------|
| 需求 | 典型输出 | 首先检查 |
| 工单分流 | 类别标签 | 标签边界是否清楚 |
| 地址抽取 | 原文片段和位置 | 地址格式与范围 |
| 制度检索 | 排序后的证据段落 | 文档是否正确入库 |
| 制度问答 | 回答、引用、状态 | 证据能否支持结论 |
| 对话执行 | 动作与参数 | 权限、确认与幂等性 |
本章检查点:把"做一个智能助手"改写为三个能够单独验收的小任务。需求越具体,越容易选模型、准备数据和解释失败。