位置偏差估计与无偏排序学习------WSDM 2018论文精读笔记
阅读笔记 · 来源:谷歌团队 WSDM 2018 论文《Position Bias Estimation for Unbiased Learning to Rank in Personal Search》
背景:WSDM 会议
WSDM(International Conference on Web Search and Data Mining,国际搜索和数据挖掘大会)自2008年首次举办,虽然只有十余年历史,但已迅速成长为数据挖掘领域仅次于 KDD 的顶级学术会议。WSDM 的一大特色是工业界参与度极高------无论是投稿、发表还是评审委员会,都有大量工业界背景的学者,这也使得会议成果兼具学术前沿性与工程实践价值。
作者团队
论文全部作者均来自谷歌:
- 王选珲(Xuanhui Wang):2015年加入谷歌,此前在 Facebook 从事广告系统开发三年,雅虎科学家两年;2009年于伊利诺伊大学香槟分校获得计算机博士学位,师从信息检索领域著名华人学者翟成祥。
- 纳达夫·古尔班迪(Nadav Golbandi):2016年加入谷歌,此前在雅虎研究院担任主任级研究工程师8年,以色列 IBM 研究院6年。
- 迈克尔·本德斯基(Michael Bendersky):2012年加入谷歌,负责个人及企业信息系统(Google Drive)研发;师从信息检索权威布鲁斯·夸夫特(Bruce Croft)。
- 唐纳德·梅泽尔(Donald Metzler):2012年加入谷歌,负责 Google Drive 搜索质量;同样师从 Bruce Croft,曾于雅虎研究院及南加州大学任职。
- 马克·诺瓦克(Marc Najork):2014年加入谷歌,任研发总监;此前在微软研究院13年、DEC 研究院8年;曾任 ACM Transactions on the Web 主编,引用数超七千。
论文核心贡献
搜索系统中普遍存在各种偏差(Bias),如何准确建模偏差是搜索系统机器学习的重要挑战。业界主要有三类处理方式:
- 人工标注相关度:传统信息检索方法,不依赖用户交互数据,自然不存在偏差估计问题。
- 点击模型(Click Model):使用概率图模型同时估计相关度和偏差,过去十年发展成熟,但多数应用仅关注相关度提取,对偏差估计精度并不在意。
- 因果推断 + 排序学习:近几年新兴方向,直接对偏差建模。WSDM 2017 最佳论文已展示该思路,但未深入探讨偏差估计与点击模型之间的关系。
本文的核心贡献:借鉴点击模型的思路更精确地估计位置偏差,从而训练出更好的排序模型。同时探索如何在较少随机数据的前提下做好偏差估计,提出了**基于回归的期望最大化(Regression-based EM)**算法。
核心方法
位置偏差与无偏指标
当已知"偏差值(Propensity Score)"------即用户看到每个文档位置的概率时,可以构造**无偏精度(Unbiased Precision)**等指标来真实衡量系统效果。其核心思想是对不同位置的点击赋予不同权重:高位置文档获得点击较"容易",权重低;低位置文档获得点击较"难得",权重高。这基于"位置偏差(Position Bias)"假设------无论文档本身质量如何,放在高位都更容易获得点击。
偏差值估计的三种策略
**位置偏差模型(Position Bias Model)**将用户点击概率分解为两个因子的乘积:用户看到该位置的概率 × 文档自身相关度概率。估计这两个概率是核心任务。
| 策略 | 做法 | 代价 |
|---|---|---|
| 完全随机化 | 对所有结果随机重排,直接用点击率估计相关度 | 严重损害用户体验 |
| 配对随机化 | 仅对相邻位置(第1与第2、第2与第3...)互换 | 体验稍好,但仍有损失 |
| 直接参数估计 | 不依赖随机化,直接估计位置概率和相关度概率 | 需解决数据稀疏问题 |
Regression-based EM 算法
传统期望最大化(EM)算法需要对每个"查询关键字-文档"配对独立估计,而用户数据中这种配对往往非常稀疏。作者提出用回归模型估计文档与查询的相关度,同时用 EM 算法估计位置偏差,两者协同迭代,有效缓解数据不足的问题。
实验结果
实验基于谷歌邮件和文件存储的搜索数据,使用2017年4月两周日志,约四百万个查询关键字,每个关键字平均五个结果。结果表明:
- 提出的方法能够更有效地捕捉文档位置偏差
- 利用该方法训练的排序模型比未考虑偏差的模型提升 1%~2%
要点回顾
- 位置偏差是搜索系统中的核心偏差之一,准确估计偏差值是实现无偏排序学习的前提。
- 完全随机化或配对随机化虽能消除偏差,但会损害用户体验;直接参数估计是更实用的方案。
- Regression-based EM 算法将回归模型与期望最大化结合,在真实用户数据上取得了显著排序效果提升。