《SIGIR 2018论文精读|深度学习点击序列模型:对搜索页面点击行为进行序列建模》

阅读笔记

论文背景与作者

本次精读的是 SIGIR 2018 会议论文《页面搜索的点击序列模型》(A Click Sequence Model for Web Search)。

论文围绕搜索引擎结果页上用户的点击行为展开研究。在此之前,同届最佳论文处理了推荐系统中的偏差建模问题,最佳短论文则利用对抗学习提升排序模型的鲁棒性;而本文聚焦于搜索领域中经典且活跃的研究课题------点击行为建模。

主要作者信息:

  • 第一作者阿列克谢·博里索夫(Alexey Borisov)来自俄罗斯搜索引擎 Yandex,同时在阿姆斯特丹大学攻读博士学位,此前已发表多篇将"点击模型"与深度学习结合的论文。
  • 第二作者马丁·万德纳(Martijn Wardenaar)、第三作者伊雅·马尔科夫(Ilya Markov)以及通讯作者马顿·德里克(Maarten de Rijke)均来自阿姆斯特丹大学。马顿是荷兰计算机科学家、欧洲信息检索领域学术权威,并入选荷兰皇家科学院。

论文主要贡献

论文的核心思想:利用深度学习模型对用户在搜索页面上的点击行为进行建模。

传统思路"点击模型"从 2000 年起步,近十年间涌现出几十种不同变体,总体是对不同的用户行为进行编码,以更准确地预测点击。多数传统点击模型为简化建模,常假设每个查询关键词下用户只点击一次结果,从而方便地对浏览、点击及位置偏差等进行建模。但实际场景中,同一查询关键词下用户往往会点击多个结果,因此对多点击序列的建模变得十分重要。

本文的两点主要贡献:

  1. 对点击行为进行序列建模:能够轻松针对每个搜索页面进行预测,例如会发生多少次点击、在哪些位置发生点击。
  2. 引入循环神经网络(RNN):将深度学习引入查询关键词的结果建模,拓宽了传统纯概率点击模型在深度学习时代的表现力。

核心方法

方法的核心思路:针对每一个查询关键词,模型需要对所有可能的点击序列进行建模,该任务通过构建神经网络完成。模型包含两个重要模块------编码器(Encoder)与解码器(Decoder)。

编码器

  • 以查询关键词和搜索结果为输入,生成它们的"嵌入向量"(Embedding Vector)。
  • 嵌入向量是深度学习建模中的常用技术,将离散变量信息转化为连续信息,把查询关键词和搜索结果映射到一个共同的语义空间,可视为中间结果或隐含变量。
  • 一个好的嵌入向量需包含三部分信息:当前结果的信息、当前结果周围(上下文)的结果信息、以及查询关键词的信息,从而让每个搜索结果作为独立单元携带足够丰富的信息。
  • 构建分两步:先把查询关键词和每个搜索结果转换为第一层次嵌入向量 ;再借助循环神经网络,对当前结果前后的结果进行正、反两次编码,得到第二层次嵌入向量,后者即为最终表征每个搜索结果的向量。

解码器

  • 根据中间嵌入向量,决定在哪个位置上会发生(或不会发生)点击------本质上是一个多类分类问题
  • 引入一个特殊符号代表序列终止,模型同时需要预测是否终止,这种处理在深度序列建模中十分常见。
  • 利用"关注"(Attention)机制对每个搜索结果施加不同权重:每个时间点(即每次"是否点击"决策)之后都会重新生成一组关注向量。核心是一个循环神经网络,自行更新内部状态变量,并结合关注向量与输入的嵌入向量预测下一个点击的位置。

最优序列的生成与模型训练

  • 模型可预测多种不同的点击序列,因此需要生成最有可能的 K 个序列。本文采用"集束搜索"(Beam Search)近似生成最佳 K 个序列,K 取值为 1024。
  • 训练采用标准 SGDAdam 优化法,并使用梯度裁剪(Gradient Clipping)防止优化过程中出现梯度爆炸问题。

实验结果

实验基于 Yandex(俄罗斯搜索引擎)的数据开展。由于此前没有类似模型,文章没有可直接比较的其他模型,主要评估方式为:考察历史数据中已发生的点击序列能否被正确预测,即是否出现在模型认为最有可能的 K 个点击序列中。这也是选择 K=1024 的原因------在此条件下,接近 97% 的历史序列都落在模型的预测序列中。

此外,作者还评估了模型预测总的点击次数等一系列与点击预测相关的任务。所提出的模型均能以接近 1 的概率预测所有点击,并优于以往基于概率的点击模型。结果表明,该模型能够对用户在搜索页面的点击行为进行有效建模。

小结

要点回顾:

  1. 论文解决的问题与贡献:对用户在搜索页面上的点击行为进行序列建模。
  2. 核心方法:编码器与解码器两个模块,编码器生成富含上下文信息的嵌入向量,解码器结合注意力机制与 RNN 逐点预测点击位置及序列终止。
  3. 实验结果:在 Yandex 数据上,以接近 1 的概率预测所有点击,97% 的历史点击序列落在模型预测的 Top-1024 序列内,优于传统概率点击模型。
相关推荐
疯狂打码的少年2 小时前
【数据库技术】关系完整性约束(实体/参照/用户定义)
运维·服务器·数据库·笔记
十三画者2 小时前
【文献分享】PANORAMIC:用于空间组学共定位分析的分层不确定性传播框架
人工智能·深度学习·数据挖掘·数据分析·集成学习
sunshine22 girl3 小时前
Angular7,9,学习笔记四 父子组件传值,组件之间传值
笔记·学习
sel_93 小时前
【PEFT】参数高效微调(PEFT)技术详解:从原理到 LoRA/QLoRA 实战
人工智能·python·深度学习·算法·机器学习·参数高效微调
蒸蒸yyyyzwd4 小时前
cpp选手秋招学习笔记 day18
笔记·学习
AI人工智能+4 小时前
通用表格识别技术:突破传统OCR只能提取零散文本、却读不懂表格行列结构与合并单元格的局限性
深度学习·ocr·表格识别
Hotchip_MEMS4 小时前
从“手工作坊”到“全自动贴装”:MEMS如何重塑雾化器制造流程
人工智能·笔记·物联网·电脑·制造
阳明山水5 小时前
Mamba与两阶段XGBoost的融合架构:面向间歇性需求的双路径预测框架
人工智能·深度学习·算法·机器学习·架构
维克兜率天5 小时前
【维克】技术指标是什么:从均线到MACD的数学原理
人工智能·笔记·python·算法·量化
sel_95 小时前
【vLLM】vLLM 推理框架详解:从 PagedAttention 到生产级部署实战
人工智能·深度学习·算法·语言模型·框架·vllm