位置偏差估计与无偏排序学习——WSDM 2018论文精读笔记

位置偏差估计与无偏排序学习------WSDM 2018论文精读笔记

阅读笔记 · 来源:谷歌团队 WSDM 2018 论文《Position Bias Estimation for Unbiased Learning to Rank in Personal Search》

背景:WSDM 会议

WSDM(International Conference on Web Search and Data Mining,国际搜索和数据挖掘大会)自2008年首次举办,虽然只有十余年历史,但已迅速成长为数据挖掘领域仅次于 KDD 的顶级学术会议。WSDM 的一大特色是工业界参与度极高------无论是投稿、发表还是评审委员会,都有大量工业界背景的学者,这也使得会议成果兼具学术前沿性与工程实践价值。

作者团队

论文全部作者均来自谷歌:

  • 王选珲(Xuanhui Wang):2015年加入谷歌,此前在 Facebook 从事广告系统开发三年,雅虎科学家两年;2009年于伊利诺伊大学香槟分校获得计算机博士学位,师从信息检索领域著名华人学者翟成祥。
  • 纳达夫·古尔班迪(Nadav Golbandi):2016年加入谷歌,此前在雅虎研究院担任主任级研究工程师8年,以色列 IBM 研究院6年。
  • 迈克尔·本德斯基(Michael Bendersky):2012年加入谷歌,负责个人及企业信息系统(Google Drive)研发;师从信息检索权威布鲁斯·夸夫特(Bruce Croft)。
  • 唐纳德·梅泽尔(Donald Metzler):2012年加入谷歌,负责 Google Drive 搜索质量;同样师从 Bruce Croft,曾于雅虎研究院及南加州大学任职。
  • 马克·诺瓦克(Marc Najork):2014年加入谷歌,任研发总监;此前在微软研究院13年、DEC 研究院8年;曾任 ACM Transactions on the Web 主编,引用数超七千。

论文核心贡献

搜索系统中普遍存在各种偏差(Bias),如何准确建模偏差是搜索系统机器学习的重要挑战。业界主要有三类处理方式:

  1. 人工标注相关度:传统信息检索方法,不依赖用户交互数据,自然不存在偏差估计问题。
  2. 点击模型(Click Model):使用概率图模型同时估计相关度和偏差,过去十年发展成熟,但多数应用仅关注相关度提取,对偏差估计精度并不在意。
  3. 因果推断 + 排序学习:近几年新兴方向,直接对偏差建模。WSDM 2017 最佳论文已展示该思路,但未深入探讨偏差估计与点击模型之间的关系。

本文的核心贡献:借鉴点击模型的思路更精确地估计位置偏差,从而训练出更好的排序模型。同时探索如何在较少随机数据的前提下做好偏差估计,提出了**基于回归的期望最大化(Regression-based EM)**算法。

核心方法

位置偏差与无偏指标

当已知"偏差值(Propensity Score)"------即用户看到每个文档位置的概率时,可以构造**无偏精度(Unbiased Precision)**等指标来真实衡量系统效果。其核心思想是对不同位置的点击赋予不同权重:高位置文档获得点击较"容易",权重低;低位置文档获得点击较"难得",权重高。这基于"位置偏差(Position Bias)"假设------无论文档本身质量如何,放在高位都更容易获得点击。

偏差值估计的三种策略

**位置偏差模型(Position Bias Model)**将用户点击概率分解为两个因子的乘积:用户看到该位置的概率 × 文档自身相关度概率。估计这两个概率是核心任务。

策略 做法 代价
完全随机化 对所有结果随机重排,直接用点击率估计相关度 严重损害用户体验
配对随机化 仅对相邻位置(第1与第2、第2与第3...)互换 体验稍好,但仍有损失
直接参数估计 不依赖随机化,直接估计位置概率和相关度概率 需解决数据稀疏问题

Regression-based EM 算法

传统期望最大化(EM)算法需要对每个"查询关键字-文档"配对独立估计,而用户数据中这种配对往往非常稀疏。作者提出用回归模型估计文档与查询的相关度,同时用 EM 算法估计位置偏差,两者协同迭代,有效缓解数据不足的问题。

实验结果

实验基于谷歌邮件和文件存储的搜索数据,使用2017年4月两周日志,约四百万个查询关键字,每个关键字平均五个结果。结果表明:

  • 提出的方法能够更有效地捕捉文档位置偏差
  • 利用该方法训练的排序模型比未考虑偏差的模型提升 1%~2%

要点回顾

  1. 位置偏差是搜索系统中的核心偏差之一,准确估计偏差值是实现无偏排序学习的前提。
  2. 完全随机化或配对随机化虽能消除偏差,但会损害用户体验;直接参数估计是更实用的方案。
  3. Regression-based EM 算法将回归模型与期望最大化结合,在真实用户数据上取得了显著排序效果提升。
相关推荐
智者知已应修善业4 小时前
【4060BD_5V应用电路图】2022-12-24
驱动开发·经验分享·笔记·硬件架构·硬件工程
小弥儿4 小时前
GitHub今日热榜 | 2026-09-18:腾讯双项目上榜
学习·开源
知识分享小能手6 小时前
深度学习学习教程,从入门到精通,深度生成模型 —— 知识点详解与代码实现(20)
人工智能·深度学习·学习
m4Rk_7 小时前
【论文阅读】Agent 记忆机制(74):CompassMem——从相似度检索走向事件图上的记忆导航
论文阅读·人工智能·学习·开源·github
小李不想当小白7 小时前
DMA直接存储器存取(STM32标准库学习笔记)
笔记·stm32·单片机·嵌入式硬件·学习·分享
2601_949950639 小时前
练题簿在线练题全流程:从资料导入到模拟考试与错题复盘
学习·考研·小程序·刷题·小程序推荐
2601_965384269 小时前
口腔黏膜清洁的工程化路径:从表面形貌表征到清洁策略匹配
经验分享·笔记
泡泡鱼(敲代码中)9 小时前
Python 容器类型学习笔记:列表、元组、字典、集合
开发语言·笔记·python·pycharm
别动我齐刘海9 小时前
ROS2 Jazzy + C++ 实战路线——基础学习2
c++·人工智能·vscode·python·学习·机器学习·机器人
Hotchip_MEMS11 小时前
传统咪头与MEMS硅麦:雾化器气流传感方案对比
人工智能·笔记·物联网·电脑·制造