NLP CH10 问答系统复习

1. 专家系统

特点

  • 问题聚焦:限定在特定领域。
  • 数据结构化:使用结构化的领域知识。
  • 数据库支持:后台有一个数据库,保存系统可提供的各种数据。
  • 查询机制:用户提问时,系统将问题转换为 SQL 查询语句,从数据库中检索数据并提供给用户。

构建系统的关键

  1. 结构化数据库:构建一个特定领域的完备结构数据库。
  2. 查询转换:能够准确、高效地将问题转化为查询语言形式的查询。

局限性

  • 应用范围有限:通常只能用于限定领域。

2. 检索式问答系统

特点

  • 开放领域:问题领域不受限。
  • 基于非结构化数据:主要依赖Web数据。
  • 检索内容简短:通常为词或词组。

处理框架


流水线方式
  • 主要框架 :主要为Document Retriever 和 Document Reader两步
  • 典型研究
    • DrQA:基于维基百科的流水线问答系统,结合文档检索与阅读理解。
  • 答案重排序
    • 基于"多片段证据聚合"的方法(Wang等,ICLR 2018),结合不同片段的证据进行答案重排序。
端到端方式
  • Retriever-Reader联合学习
    • 研究动机:通过联合学习整合检索与阅读任务,减少中间步骤对性能的影响。
    • 方法:利用BERT等神经网络,训练问题-答案对而非完整文档数据。
    • 典型研究
      • ORQA(Latent Retrieval for Weakly Supervised QA):通过"逆向填空任务"预训练检索器,提升检索效率。
  • 基于预训练的Retriever-Free方法
    • 直接使用大规模预训练模型(如GPT-2, T5)记忆知识,从模型中直接生成答案,无需文档检索。
  • 小结 :在非结构化数据上的大规模预训练模型在不需要检索外部知识的情况下,在开放域QA上获得了和有监督方法匹敌的效果。模型效果很大程度上受模型规模的影响。

3. 社区问答系统

任务定义:根据用户所提问题,找到社区中与之相应的答案

特点

  • 丰富的元数据:包括用户类型、问题类型、问题发布时间等。
  • 文本长度较长:问题和答案通常包含大量噪声。
  • 答案质量差异大

优势

  • 个性化与开放域:能够解决个性化、开放域、异构、精确的问题。
  • 高质量理解与回答:社区用户相比机器能够更精准理解问题并提供高质量回答。
  • 知识积累:不断积累丰富的知识。

处理框架


  1. 问题分析
    • 理解问题。
    • 提取关键实体。
    • 构建问题语义表示。
  2. 信息检索部分
    • 检索与问题类似的问题对。
    • 返回问题的答案或相似问题列表。
  3. 答案抽取部分
    • 从检索结果中抽取答案。
    • 评估答案的质量。

具体研究方法

传统方法
  • 统计特征匹配。
  • CNN/RNN特征匹配。
最新方法
  • 答案摘要生成
    • 通过Bi-LSTM等模型生成问题引导的答案摘要,过滤噪声。
    • 代表性研究:Joint Learning of Answer Selection and Answer Summary Generation(AAAI 2020)。
  • 用户上下文建模
    • 研究用户历史回答,结合当前问题与用户相关性。
    • 代表性研究:Attentive User-Engaged Adversarial Neural Network(AAAI 2020)。
  • 融合信息
    • 通过引入外部知识(如话题信息、用户背景)改善Q-A匹配质量。

4. 知识库问答系统

主要任务

  • 知识库问答任务:给定自然语言问题,通过对问题进行语义理解和解析, 利用知识库进行查询、推理得出答案。
  • 问题描述:根据给定问题,在知识图谱中检索/推理相关实体作为答案

实现方法

  1. 语义解析(Semantic Parsing)
    • 将自然语言问题解析为逻辑形式,再转化为查询语句对知识库进行查询。
  2. 信息抽取(Information Extraction)
    • 从问题中提取实体,构建知识子图,对候选答案进行分类筛选。
  3. 向量建模(Vector Modeling)
    • 将问题和候选答案向量化,使用点积计算相关性得分,筛选最终答案。
  4. 新方向
    • 结合文本和知识图谱,构建异构图(如GRAFT-Net),引入非结构化文本知识。
    • 基于图神经网络(GNN)进行知识表示学习和推理。

最新研究方向

  • 融合知识的大模型问答(Knowledge-Augmented LLM)
    • 将知识图谱信息注入到大语言模型的提示(prompt)中。
    • 研究代表
      • Knowledge-Augmented Language Model Prompting。
      • Graph Neural Prompting with Large Language Models。

优势与局限

优势
  • 准确性:人工构建的知识库确保了答案的准确性。
  • 多步推理:知识图谱的图结构支持多步推理问答。
  • 常识覆盖:常识或"简单"问题容易在知识图谱中找到答案。
局限性
  • 知识覆盖有限:只能回答依据知识图谱中存在的问题,涉及的实体与关系有限。
  • 实时更新困难:知识图谱无法实时更新,影响回答的时效性。
相关推荐
一碗白开水一7 小时前
入门实践工程九:基于 BERT 的中文情感分类微调~附:安装依赖库及工程源码
人工智能·深度学习·机器学习·自然语言处理·分类·bert
Zkaisen12 小时前
第三章 · 大语言模型基础(详尽展开版)
人工智能·语言模型·自然语言处理
小白说大模型13 小时前
LLM(大语言模型)到底是怎么工作的?
人工智能·语言模型·自然语言处理
Zzj_tju16 小时前
Reasoning Models 论文精读路线:CoT、Self-Consistency、Process Supervision 与 Search
人工智能·深度学习·自然语言处理
合调于形1 天前
Bianfchheng (Baf) 《边城(八)》全文汉语拼音字母标调实测案例
人工智能·自然语言处理·人机交互·语音识别·学习方法
仙女修炼史2 天前
word2Vec理解(下):本质理解
人工智能·自然语言处理·word2vec
weixin_446260852 天前
通过恶意输入操控大语言模型行为的MCP环境搭建及应用研究
人工智能·语言模型·自然语言处理
AI人工智能+2 天前
一种高效、精准的不动产权证书智能识别技术,打通了物理世界与数字世界的信息壁垒
深度学习·计算机视觉·自然语言处理·ocr·不动产权证书识别
额恩662 天前
预训练模型:从BERT到GPT的进化之路
人工智能·自然语言处理
额恩662 天前
NLP文本预处理与文本表示:知识点总结与详细讲解
人工智能·自然语言处理·easyui