1.1 从一句话看完整任务
输入:"三号楼电梯又停了,昨天刚修过,请明天上午来看看。"人可以从中理解位置、设施、故障、重复发生的情况和希望的处理时间。计算机拿到的起点只是一串编码后的字符,需要通过规则或模型,把它转换为任务所需的信息。
如果目标是工单分流,输出可能是"报修";如果目标是信息抽取,输出可能包含楼栋、设备、故障现象和预约时间;如果目标是客服问答,输出还需要结合制度判断受理流程。相同文本对应不同任务,没有一个脱离任务定义的"理解分数"。
一个可靠系统通常不是单个模型完成全部工作。文本进入系统后,可以先做格式检查,再做分类和抽取,最后由程序校验、查询数据库、执行权限检查。模型提供候选结果,业务程序负责确定哪些结果可以被采用。
1.2 AI、机器学习、深度学习、NLP与LLM
表 1 1.2 AI、机器学习、深度学习、NLP与LLM
|------------|--------------|----------------|
| 概念 | 研究重点 | 直观例子 |
| 人工智能 AI | 让机器完成需要智能的任务 | 规划路线、识别图像、语言问答 |
| 机器学习 ML | 从数据中学习规律 | 根据历史留言预测工单类别 |
| 深度学习 DL | 用多层神经网络学习表示 | 学习文本的上下文特征 |
| 自然语言处理 NLP | 处理人类语言 | 分词、检索、翻译、摘要 |
| 大语言模型 LLM | 大规模语言建模及其应用 | 根据上下文生成回答 |
这些概念不是一条完全整齐的包含链。深度学习是机器学习的一类方法;NLP是一个研究领域,既可以用规则,也可以用机器学习;LLM是现代NLP的重要工具,但NLP不等于LLM。正则表达式提取编号仍然是文本处理的一部分,并不因为没有大模型就过时。
1.3 NLU与NLG
自然语言理解(NLU)强调把语言转成可用的意义或结构,例如意图分类、实体识别和关系判断。自然语言生成(NLG)强调从信息生成语言,例如根据工单字段生成处理通知。现代生成模型可以把两类任务都表现为"输入一段文字,输出一段文字",但评价标准仍然不同。
分类任务关心类别是否正确;抽取任务关心字段有没有漏掉或编造;摘要任务关心是否保留关键事实;问答任务还要检查证据和拒答。不能因为输出看起来通顺,就认为模型完成了所有任务。
1.4 "理解语言"不等于"拥有人的理解方式"
模型可以在很多任务中表现出有效的语言能力,但不能仅凭一段流畅对话判断它拥有人的经验、意识或稳定世界观。工程上更可操作的问题是:面对新表达、否定句、跨句指代和无答案问题,它是否仍然可靠?它能否说明证据来自哪里?
例如模型把"电梯并没有坏,只是保养"判成报修,说明它可能依赖"电梯""坏"等局部线索,而没有充分处理否定和语境。真正了解一个系统,应当关注它的适用边界,而不只是成功案例。
1.5 本章检查点
请分别为"给留言分类""从留言提取地点""回答报修流程"写出输入、输出和正确标准。参考思路:同样输入是文本,输出分别是标签、字段和带依据的回答,因此数据、模型及评价方式都可能不同。