位置偏差估计与无偏排序学习——WSDM 2018论文精读笔记

位置偏差估计与无偏排序学习------WSDM 2018论文精读笔记

阅读笔记 · 来源:谷歌团队 WSDM 2018 论文《Position Bias Estimation for Unbiased Learning to Rank in Personal Search》

背景:WSDM 会议

WSDM(International Conference on Web Search and Data Mining,国际搜索和数据挖掘大会)自2008年首次举办,虽然只有十余年历史,但已迅速成长为数据挖掘领域仅次于 KDD 的顶级学术会议。WSDM 的一大特色是工业界参与度极高------无论是投稿、发表还是评审委员会,都有大量工业界背景的学者,这也使得会议成果兼具学术前沿性与工程实践价值。

作者团队

论文全部作者均来自谷歌:

  • 王选珲(Xuanhui Wang):2015年加入谷歌,此前在 Facebook 从事广告系统开发三年,雅虎科学家两年;2009年于伊利诺伊大学香槟分校获得计算机博士学位,师从信息检索领域著名华人学者翟成祥。
  • 纳达夫·古尔班迪(Nadav Golbandi):2016年加入谷歌,此前在雅虎研究院担任主任级研究工程师8年,以色列 IBM 研究院6年。
  • 迈克尔·本德斯基(Michael Bendersky):2012年加入谷歌,负责个人及企业信息系统(Google Drive)研发;师从信息检索权威布鲁斯·夸夫特(Bruce Croft)。
  • 唐纳德·梅泽尔(Donald Metzler):2012年加入谷歌,负责 Google Drive 搜索质量;同样师从 Bruce Croft,曾于雅虎研究院及南加州大学任职。
  • 马克·诺瓦克(Marc Najork):2014年加入谷歌,任研发总监;此前在微软研究院13年、DEC 研究院8年;曾任 ACM Transactions on the Web 主编,引用数超七千。

论文核心贡献

搜索系统中普遍存在各种偏差(Bias),如何准确建模偏差是搜索系统机器学习的重要挑战。业界主要有三类处理方式:

  1. 人工标注相关度:传统信息检索方法,不依赖用户交互数据,自然不存在偏差估计问题。
  2. 点击模型(Click Model):使用概率图模型同时估计相关度和偏差,过去十年发展成熟,但多数应用仅关注相关度提取,对偏差估计精度并不在意。
  3. 因果推断 + 排序学习:近几年新兴方向,直接对偏差建模。WSDM 2017 最佳论文已展示该思路,但未深入探讨偏差估计与点击模型之间的关系。

本文的核心贡献:借鉴点击模型的思路更精确地估计位置偏差,从而训练出更好的排序模型。同时探索如何在较少随机数据的前提下做好偏差估计,提出了**基于回归的期望最大化(Regression-based EM)**算法。

核心方法

位置偏差与无偏指标

当已知"偏差值(Propensity Score)"------即用户看到每个文档位置的概率时,可以构造**无偏精度(Unbiased Precision)**等指标来真实衡量系统效果。其核心思想是对不同位置的点击赋予不同权重:高位置文档获得点击较"容易",权重低;低位置文档获得点击较"难得",权重高。这基于"位置偏差(Position Bias)"假设------无论文档本身质量如何,放在高位都更容易获得点击。

偏差值估计的三种策略

**位置偏差模型(Position Bias Model)**将用户点击概率分解为两个因子的乘积:用户看到该位置的概率 × 文档自身相关度概率。估计这两个概率是核心任务。

策略 做法 代价
完全随机化 对所有结果随机重排,直接用点击率估计相关度 严重损害用户体验
配对随机化 仅对相邻位置(第1与第2、第2与第3...)互换 体验稍好,但仍有损失
直接参数估计 不依赖随机化,直接估计位置概率和相关度概率 需解决数据稀疏问题

Regression-based EM 算法

传统期望最大化(EM)算法需要对每个"查询关键字-文档"配对独立估计,而用户数据中这种配对往往非常稀疏。作者提出用回归模型估计文档与查询的相关度,同时用 EM 算法估计位置偏差,两者协同迭代,有效缓解数据不足的问题。

实验结果

实验基于谷歌邮件和文件存储的搜索数据,使用2017年4月两周日志,约四百万个查询关键字,每个关键字平均五个结果。结果表明:

  • 提出的方法能够更有效地捕捉文档位置偏差
  • 利用该方法训练的排序模型比未考虑偏差的模型提升 1%~2%

要点回顾

  1. 位置偏差是搜索系统中的核心偏差之一,准确估计偏差值是实现无偏排序学习的前提。
  2. 完全随机化或配对随机化虽能消除偏差,但会损害用户体验;直接参数估计是更实用的方案。
  3. Regression-based EM 算法将回归模型与期望最大化结合,在真实用户数据上取得了显著排序效果提升。
相关推荐
yi0117 小时前
LeetCode 219:存在重复元素 II——哈希表记录“最近一次出现的位置”
数据结构·人工智能·笔记·python·算法·leetcode·哈希表
志尊宝8 小时前
Vue3 零基础每日笔记(073):keep-alive 页面缓存实战——列表页返回不丢状态
vue.js·笔记·缓存·#vue #前端 #前端开发·#javascript·#vue.js
李日华大战鸡红9 小时前
FOC状态空间方程模型推导(学习记录)
python·学习·线性代数
weixin_4481199410 小时前
Datawhale Easy Data × AI:笔记1 已重做,看新的笔记
笔记
要开心吖ZSH11 小时前
MySQL 慢 SQL 排查操作手册-个人笔记版
java·笔记·sql·mysql·慢查询
kkkkkkkkkk_Z11 小时前
新手自学嵌入式 | 学习日记:异常与中断基础、i.MX6ULL裸机开发环境搭建、GPIO模块与点灯原理
学习
咖啡忍者12 小时前
【SAP】程制造生产计划PP-PI(Production Planning for Process Industries)
笔记
m4Rk_12 小时前
【论文阅读】Agent 记忆机制(94):MemGen——在推理过程中动态生成并织入潜在记忆
论文阅读·人工智能·学习·开源·github
晓德12 小时前
0、LLM大模型安全学习系列(启)
学习·安全
Titan202413 小时前
MySQL索引学习笔记
笔记·学习·mysql