位置偏差估计与无偏排序学习——WSDM 2018论文精读笔记

位置偏差估计与无偏排序学习------WSDM 2018论文精读笔记

阅读笔记 · 来源:谷歌团队 WSDM 2018 论文《Position Bias Estimation for Unbiased Learning to Rank in Personal Search》

背景:WSDM 会议

WSDM(International Conference on Web Search and Data Mining,国际搜索和数据挖掘大会)自2008年首次举办,虽然只有十余年历史,但已迅速成长为数据挖掘领域仅次于 KDD 的顶级学术会议。WSDM 的一大特色是工业界参与度极高------无论是投稿、发表还是评审委员会,都有大量工业界背景的学者,这也使得会议成果兼具学术前沿性与工程实践价值。

作者团队

论文全部作者均来自谷歌:

  • 王选珲(Xuanhui Wang):2015年加入谷歌,此前在 Facebook 从事广告系统开发三年,雅虎科学家两年;2009年于伊利诺伊大学香槟分校获得计算机博士学位,师从信息检索领域著名华人学者翟成祥。
  • 纳达夫·古尔班迪(Nadav Golbandi):2016年加入谷歌,此前在雅虎研究院担任主任级研究工程师8年,以色列 IBM 研究院6年。
  • 迈克尔·本德斯基(Michael Bendersky):2012年加入谷歌,负责个人及企业信息系统(Google Drive)研发;师从信息检索权威布鲁斯·夸夫特(Bruce Croft)。
  • 唐纳德·梅泽尔(Donald Metzler):2012年加入谷歌,负责 Google Drive 搜索质量;同样师从 Bruce Croft,曾于雅虎研究院及南加州大学任职。
  • 马克·诺瓦克(Marc Najork):2014年加入谷歌,任研发总监;此前在微软研究院13年、DEC 研究院8年;曾任 ACM Transactions on the Web 主编,引用数超七千。

论文核心贡献

搜索系统中普遍存在各种偏差(Bias),如何准确建模偏差是搜索系统机器学习的重要挑战。业界主要有三类处理方式:

  1. 人工标注相关度:传统信息检索方法,不依赖用户交互数据,自然不存在偏差估计问题。
  2. 点击模型(Click Model):使用概率图模型同时估计相关度和偏差,过去十年发展成熟,但多数应用仅关注相关度提取,对偏差估计精度并不在意。
  3. 因果推断 + 排序学习:近几年新兴方向,直接对偏差建模。WSDM 2017 最佳论文已展示该思路,但未深入探讨偏差估计与点击模型之间的关系。

本文的核心贡献:借鉴点击模型的思路更精确地估计位置偏差,从而训练出更好的排序模型。同时探索如何在较少随机数据的前提下做好偏差估计,提出了**基于回归的期望最大化(Regression-based EM)**算法。

核心方法

位置偏差与无偏指标

当已知"偏差值(Propensity Score)"------即用户看到每个文档位置的概率时,可以构造**无偏精度(Unbiased Precision)**等指标来真实衡量系统效果。其核心思想是对不同位置的点击赋予不同权重:高位置文档获得点击较"容易",权重低;低位置文档获得点击较"难得",权重高。这基于"位置偏差(Position Bias)"假设------无论文档本身质量如何,放在高位都更容易获得点击。

偏差值估计的三种策略

**位置偏差模型(Position Bias Model)**将用户点击概率分解为两个因子的乘积:用户看到该位置的概率 × 文档自身相关度概率。估计这两个概率是核心任务。

策略 做法 代价
完全随机化 对所有结果随机重排,直接用点击率估计相关度 严重损害用户体验
配对随机化 仅对相邻位置(第1与第2、第2与第3...)互换 体验稍好,但仍有损失
直接参数估计 不依赖随机化,直接估计位置概率和相关度概率 需解决数据稀疏问题

Regression-based EM 算法

传统期望最大化(EM)算法需要对每个"查询关键字-文档"配对独立估计,而用户数据中这种配对往往非常稀疏。作者提出用回归模型估计文档与查询的相关度,同时用 EM 算法估计位置偏差,两者协同迭代,有效缓解数据不足的问题。

实验结果

实验基于谷歌邮件和文件存储的搜索数据,使用2017年4月两周日志,约四百万个查询关键字,每个关键字平均五个结果。结果表明:

  • 提出的方法能够更有效地捕捉文档位置偏差
  • 利用该方法训练的排序模型比未考虑偏差的模型提升 1%~2%

要点回顾

  1. 位置偏差是搜索系统中的核心偏差之一,准确估计偏差值是实现无偏排序学习的前提。
  2. 完全随机化或配对随机化虽能消除偏差,但会损害用户体验;直接参数估计是更实用的方案。
  3. Regression-based EM 算法将回归模型与期望最大化结合,在真实用户数据上取得了显著排序效果提升。
相关推荐
kdxiaojie3 小时前
Linux 驱动研究 —— SDIO (1)
linux·运维·笔记·学习·sdio
3A Cloud4 小时前
Architecture Diagram Skill 详细介绍
人工智能·笔记·信息可视化
疯狂打码的少年5 小时前
【数据结构】栈:定义、顺序栈与链式栈
数据结构·笔记
我能坚持多久6 小时前
优选算法——专题一双指针(上):附四道例题详解
c++·学习·算法
zzm6286 小时前
WSDM 2018论文精读:基于多关系学习与路径约束的商品替代互补关系挖掘
人工智能·学习
IT古董6 小时前
【MES学习笔记系列】MES 术语表
笔记·学习
Anesthesia丶8 小时前
PromoxVE安装笔记
笔记·ubuntu·server·promox
疯狂打码的少年8 小时前
【数据结构】顺序表 vs 链表的对比与选择
数据结构·笔记·链表
Nontee9 小时前
首个开源 PR 从 0 到合并:Reasonix 修复全流程复盘
笔记·学习·github