位置偏差估计与无偏排序学习——WSDM 2018论文精读笔记

位置偏差估计与无偏排序学习------WSDM 2018论文精读笔记

阅读笔记 · 来源:谷歌团队 WSDM 2018 论文《Position Bias Estimation for Unbiased Learning to Rank in Personal Search》

背景:WSDM 会议

WSDM(International Conference on Web Search and Data Mining,国际搜索和数据挖掘大会)自2008年首次举办,虽然只有十余年历史,但已迅速成长为数据挖掘领域仅次于 KDD 的顶级学术会议。WSDM 的一大特色是工业界参与度极高------无论是投稿、发表还是评审委员会,都有大量工业界背景的学者,这也使得会议成果兼具学术前沿性与工程实践价值。

作者团队

论文全部作者均来自谷歌:

  • 王选珲(Xuanhui Wang):2015年加入谷歌,此前在 Facebook 从事广告系统开发三年,雅虎科学家两年;2009年于伊利诺伊大学香槟分校获得计算机博士学位,师从信息检索领域著名华人学者翟成祥。
  • 纳达夫·古尔班迪(Nadav Golbandi):2016年加入谷歌,此前在雅虎研究院担任主任级研究工程师8年,以色列 IBM 研究院6年。
  • 迈克尔·本德斯基(Michael Bendersky):2012年加入谷歌,负责个人及企业信息系统(Google Drive)研发;师从信息检索权威布鲁斯·夸夫特(Bruce Croft)。
  • 唐纳德·梅泽尔(Donald Metzler):2012年加入谷歌,负责 Google Drive 搜索质量;同样师从 Bruce Croft,曾于雅虎研究院及南加州大学任职。
  • 马克·诺瓦克(Marc Najork):2014年加入谷歌,任研发总监;此前在微软研究院13年、DEC 研究院8年;曾任 ACM Transactions on the Web 主编,引用数超七千。

论文核心贡献

搜索系统中普遍存在各种偏差(Bias),如何准确建模偏差是搜索系统机器学习的重要挑战。业界主要有三类处理方式:

  1. 人工标注相关度:传统信息检索方法,不依赖用户交互数据,自然不存在偏差估计问题。
  2. 点击模型(Click Model):使用概率图模型同时估计相关度和偏差,过去十年发展成熟,但多数应用仅关注相关度提取,对偏差估计精度并不在意。
  3. 因果推断 + 排序学习:近几年新兴方向,直接对偏差建模。WSDM 2017 最佳论文已展示该思路,但未深入探讨偏差估计与点击模型之间的关系。

本文的核心贡献:借鉴点击模型的思路更精确地估计位置偏差,从而训练出更好的排序模型。同时探索如何在较少随机数据的前提下做好偏差估计,提出了**基于回归的期望最大化(Regression-based EM)**算法。

核心方法

位置偏差与无偏指标

当已知"偏差值(Propensity Score)"------即用户看到每个文档位置的概率时,可以构造**无偏精度(Unbiased Precision)**等指标来真实衡量系统效果。其核心思想是对不同位置的点击赋予不同权重:高位置文档获得点击较"容易",权重低;低位置文档获得点击较"难得",权重高。这基于"位置偏差(Position Bias)"假设------无论文档本身质量如何,放在高位都更容易获得点击。

偏差值估计的三种策略

**位置偏差模型(Position Bias Model)**将用户点击概率分解为两个因子的乘积:用户看到该位置的概率 × 文档自身相关度概率。估计这两个概率是核心任务。

策略 做法 代价
完全随机化 对所有结果随机重排,直接用点击率估计相关度 严重损害用户体验
配对随机化 仅对相邻位置(第1与第2、第2与第3...)互换 体验稍好,但仍有损失
直接参数估计 不依赖随机化,直接估计位置概率和相关度概率 需解决数据稀疏问题

Regression-based EM 算法

传统期望最大化(EM)算法需要对每个"查询关键字-文档"配对独立估计,而用户数据中这种配对往往非常稀疏。作者提出用回归模型估计文档与查询的相关度,同时用 EM 算法估计位置偏差,两者协同迭代,有效缓解数据不足的问题。

实验结果

实验基于谷歌邮件和文件存储的搜索数据,使用2017年4月两周日志,约四百万个查询关键字,每个关键字平均五个结果。结果表明:

  • 提出的方法能够更有效地捕捉文档位置偏差
  • 利用该方法训练的排序模型比未考虑偏差的模型提升 1%~2%

要点回顾

  1. 位置偏差是搜索系统中的核心偏差之一,准确估计偏差值是实现无偏排序学习的前提。
  2. 完全随机化或配对随机化虽能消除偏差,但会损害用户体验;直接参数估计是更实用的方案。
  3. Regression-based EM 算法将回归模型与期望最大化结合,在真实用户数据上取得了显著排序效果提升。
相关推荐
我想我不够好。11 分钟前
豹女q w e r衔接闪现
学习
金立基包装胶水12 分钟前
纸袋热封频繁不良,先排查胶料这一堆问题
大数据·笔记·其他
常驻客栈40 分钟前
B-深入理解计算机系统第3版之第11章:网络编程
开发语言·笔记·学习笔记·常驻客栈·深入理解计算机系统
血小板要健康1 小时前
网格 dfs 与 FloodFill:从岛屿、区域到搜索路径
笔记·算法·leetcode·深度优先
NoteDeep 深度笔记1 小时前
Observer: 思维 ≠ 自己
笔记
米饭不加菜1 小时前
一些常用模块简介
经验分享·笔记·嵌入式硬件
aichitang20242 小时前
希尔伯特空间中的正交性
人工智能·学习·机器学习·ai·泛函分析
for_ever_love__2 小时前
python基础语法学习: 正则表达式
python·学习·正则表达式
佳児素花痴╮2 小时前
STM32U575RIT6(USART)学习
stm32·嵌入式硬件·学习
sunshine22 girl2 小时前
Angular7,9,学习笔记三 dom操作
笔记·学习·angular