ACL 2018 论文精读:副词性前提触发词的自动检测
一、论文背景论文来自加拿大麦吉尔大学(McGill University)计算机系,共同第一作者为三位学生作者,导师张智杰(Jackie Chi Kit Cheung)助理教授为末位作者。张智杰于 2014 年从多伦多大学博士毕业,曾两次在微软研究院实习,长期从事自然语言处理研究。研究背景是语言学中的语用学 (Pragmatics)。语用学是语言学的一个分支,与符号学理论相互交叉渗透,研究语境对语言含义产生的影响与贡献,涵盖言语行为理论、对话内涵义、交流中的对话,以及从哲学、社会学、语言学、人类学等角度对人类语言行为的解析。## 二、核心概念- 前提(Presuppositions) :交谈参与者共同约定的假设和认知,在谈话中被广泛使用。- 前提触发(Presupposition Triggers) :提示"前提"的表达,包括一些动词、副词和其他短语。典型例子 :1. 约翰再次要去那家餐厅(John is going to the restaurant again )。2. 约翰已经去过了那家餐厅(John has been to the restaurant)。第一句话要成立必须建立在第二句话真实的基础上。"再"(Again)这一触发词的使用以第二句话为前提;即便对第一句话进行否定("约翰不打算再去那家餐厅了"),依然需要第二句话的支持。也就是说,前提触发词不受否定影响 ,否定不改变其前提假设。## 三、论文主要贡献1. 核心贡献 :对以副词为主的前提触发词进行检测,包括 "Again"(再)、"Also"(也)、"Still"(还)等。此前尚无针对这类词汇进行检测的学术研究工作。2. 应用场景 :文本的归纳总结(Summarization)、对话系统等。3. 数据集构建 :基于 Penn Treebank 和 English Gigaword 两个著名 NLP 语料,构建了两个新的数据集,用于触发词的分类检测。4. 模型方法 :设计了基于注意力(Attention)机制的时间递归神经网络(RNN)模型,取得了很好的效果。## 四、核心方法### 4.1 数据集生成每个数据点是一个三元组 :- 标签信息(正例 / 负例)- 文本单词- 单词对应的词类标签(POS 标签,如动词、名词)- 正例 :当前数据包含前提触发词。由于检测目标是副词性触发词,还需要知道该副词所依靠的动词,作者称之为副词的"管理词 "(Governor)。- 负例 :含有相同管理词、但不包含前提触发词的句子。正例构造流程 :扫描文档查找前提触发词 → 找到后提取其管理词 → 取管理词前 50 个单词 + 管理词后到句子结束的全部单词,组成正例。### 4.2 模型架构识别前提触发词采用双向 LSTM 基本模型架构,其上叠加注意力机制 ,在不同情况下选择 LSTM 的中间状态。模型输入两部分 :1. 词向量(Embedding) :文本单词经词向量转换,把离散数据转为连续向量数据。2. POS 标签 :单词对应的词类标签,保持离散特征表达。处理流程 :连续词向量与离散 POS 标签合并后作为双向 LSTM 输入。双向 LSTM 对输入信息的顺序进行建模------前提触发词与其管理动词和句中前后单词明显存在关联,双向结构能记忆这种结构并提取有用的中间变量。从中间变量到分类结果 :作者提出"加权池化网络 "(Weighted Pooling Network),与注意力机制配合完成中间转换:- 借鉴计算机视觉中 CNN 的池化操作处理文本:把所有 LSTM 中间状态堆叠成矩阵,用该矩阵乘以其转置,得到类似相关矩阵的新矩阵,该矩阵完全刻画了当前句子经 LSTM 中间变量转换后所有中间状态的两两关系;- 分类结果从该矩阵中按不同权重抽取信息(即"注意力"机制);- 抽取后经过全连接层,最终形成标准分类输出。## 五、实验结果在两个新数据集上,论文方法与一系列基线比较:| 对比方法 | 结果 ||---|---|| 对数几率回归(Logistic Regression) | 论文方法优 10%~20% 左右 || CNN 提取信息模型 | 论文方法优 10%~20% 左右 || 简化版双向 LSTM 模型 | 优势较小,但仍有统计意义上的显著效果 |## 六、要点回顾1. 背景与贡献 :论文以语用学为背景,核心贡献是对以副词为主的前提触发词进行检测;2. 核心方法 :提出双向 LSTM 基本架构,并利用注意力机制根据不同情况设置权重;3. 数据与效果:构建了两个新数据集,取得了优于基线方法的实验结果。