基于查看数据的 BPR 改进采样器——WWW 2018 论文精读笔记

基于查看数据的 BPR 改进采样器------WWW 2018 论文精读笔记

阅读笔记

一、论文信息

  • 论文题目:《利用查看数据,贝叶斯个性化排序的一种改进的取样器》(An Improved Sampler for Bayesian Personalized Ranking by Leveraging View Data)
  • 发表场合:万维网大会(The Web Conference / WWW)2018,优秀短论文(2 页展板论文)
  • 作者单位:清华大学、新加坡国立大学(共六位作者)

背景说明:万维网大会主要发表两类论文------10 页长论文与 2 页短论文(展板论文)。短论文用于发表短小成果或研究过程中的重要成果,每届大会评选一篇最佳短论文奖。

二、核心概念:贝叶斯个性化排序(BPR)

2.1 BPR 的本质

  • BPR 是推荐系统中的配对排序(Pairwise)学习算法
  • 与传统单点预测不同,配对排序不针对每个数据实例学习标签或响应变量,而是学习相对顺序 ,目标是把所有正例排列到负例之前
  • 关键含义:单个实例的预测值本身并不重要,算法在意的是对于「一正一负」的配对,能否把正例准确排列到负例之上------这要求在数值上正例的预测值高于负例。

2.2 BPR 解决的问题

  • 推荐系统中长期存在的问题:只对单个数据点做预测(如对用户-物品喜好矩阵建模时),大多数算法无法有效对未观测到的数据进行建模
  • BPR 作为配对算法,只需关注已观测数据及其关系,从而能够对用户喜好,特别是**隐反馈(Implicit Feedback)**数据,取得更明显效果。
  • 隐反馈的定义:并非用户明确告知系统对每个物品的喜好程度,而是用户在与系统交互过程中通过行为(如浏览、点击、购买)表达出的喜好。这类行为往往不全面,需要算法和模型进行有效建模。

三、论文主要贡献与核心方法

3.1 问题背景

  • BPR 的核心是学习配对排序问题:训练时需要对一个正例 + 一个负例的配对进行学习并更新参数。
  • 在自然的用户隐反馈数据集中,正例是少数、负例是绝大多数
  • 传统方法:组成配对时,相对一个正例,均匀地(Uniformly)选取负样本组成配对,该过程称为「采样(Sampling)」。

3.2 两大主要贡献

  1. 发现全局均匀采样的弊端:如果从全局均匀地采样负样本,第一没有必要,第二可能反而影响最终学习效果。
  2. 提出面向电子商务的负样本采样方法:让学习算法利用更多用户的「浏览(View)」信息,从而大幅提升整体训练效果。

3.3 核心方法

实验一:缩减负样本采样空间
  • 不从全局选取负样本,仅采样极小一部分(例如几百个负样本而非几万个)。
  • 实验结果:
    • 贝贝网:精确度不仅未受影响,反而有所提升;
    • 天猫:效果无提升、有轻微下降,但作者认为代价值得------数据集减少使训练时间大幅降低
  • 结论:不需要从全局进行采样
实验二:用户行为分集采样

将用户数据划分为三个集合:

集合 含义
C1 购买集(发生过购买行为)
C2 浏览但没有购买集
C3 剩下的数据
  • 作者提出:BPR 要达到最好效果,需要对三种数据集进行采样,即组成 C1-C2、C1-C3、C2-C3 的配对来学习。
  • 采样比例经验:总体上 C3 中采样的数据 > C2 > C1------即训练算法要更好地学习用户「不喜欢某件东西」的偏好。
  • 最终效果:采用该采样方式后,模型效果比传统 BPR 或仅使用「最流行的物品」作为推荐结果提升约 60%

四、实验数据集

数据集 用户数 商品数 购买次数 浏览次数 稀疏度
贝贝网(母婴产品) 约 16 万 12 万 260 万次 4600 万次 > 99%
天猫 3 万 3 万余 46 万次 150 余万次 > 99%

五、要点回顾

  1. 从高维度理解 BPR:一种基于隐反馈的配对排序学习算法;
  2. 论文主要贡献与思路:改进负样本采样策略(缩减采样空间 + 分集采样),充分利用浏览数据;
  3. 实验成果:训练效率显著提升,推荐效果相对传统 BPR 提升约 60%。

六、参考文献

  1. Steffen Rendle, Christoph Freudenthaler, Zeno Gantner, and Lars Schmidt-Thieme. BPR: Bayesian personalized ranking from implicit feedback. Proceedings of the Twenty-Fifth Conference on Uncertainty in Artificial Intelligence (UAI '09). AUAI Press, Arlington, Virginia, United States, 452-461, 2009.
相关推荐
`流年づ17 小时前
人工智能学习笔记 - 自动微分
人工智能·笔记·学习
木井巳17 小时前
【记忆化搜索】斐波那契数
java·算法·leetcode·深度优先·剪枝·推荐算法
༄久梦༒长醉༻17 小时前
技术笔记——Git Worktree工作树
笔记·git
雨田言炎18 小时前
STM32之自定义协议帧格式
网络·笔记·stm32·单片机
kaixin_啊啊18 小时前
Codex论文辅助全流程
人工智能·笔记·学习·ai·大模型
愚公移山填海18 小时前
【无标题】
笔记·python·学习·pycharm
江湖人称菠萝包18 小时前
【Windows】《深入浅出Windows API程序设计:核心编程篇》笔记-Chapter5-剪贴板
windows·笔记
志尊宝18 小时前
Vue3 零基础每日笔记(017):事件处理进阶——$event、多事件与事件修饰符全家桶
javascript·vue.js·笔记
阿洛学长18 小时前
Python笔记:dir() 和 help() 完整用法(适配Python二级 + IDLE实操)
服务器·笔记·python
qeen8719 小时前
【C++】智能指针介绍
开发语言·c++·笔记·指针