基于查看数据的 BPR 改进采样器——WWW 2018 论文精读笔记

基于查看数据的 BPR 改进采样器------WWW 2018 论文精读笔记

阅读笔记

一、论文信息

  • 论文题目:《利用查看数据,贝叶斯个性化排序的一种改进的取样器》(An Improved Sampler for Bayesian Personalized Ranking by Leveraging View Data)
  • 发表场合:万维网大会(The Web Conference / WWW)2018,优秀短论文(2 页展板论文)
  • 作者单位:清华大学、新加坡国立大学(共六位作者)

背景说明:万维网大会主要发表两类论文------10 页长论文与 2 页短论文(展板论文)。短论文用于发表短小成果或研究过程中的重要成果,每届大会评选一篇最佳短论文奖。

二、核心概念:贝叶斯个性化排序(BPR)

2.1 BPR 的本质

  • BPR 是推荐系统中的配对排序(Pairwise)学习算法
  • 与传统单点预测不同,配对排序不针对每个数据实例学习标签或响应变量,而是学习相对顺序 ,目标是把所有正例排列到负例之前
  • 关键含义:单个实例的预测值本身并不重要,算法在意的是对于「一正一负」的配对,能否把正例准确排列到负例之上------这要求在数值上正例的预测值高于负例。

2.2 BPR 解决的问题

  • 推荐系统中长期存在的问题:只对单个数据点做预测(如对用户-物品喜好矩阵建模时),大多数算法无法有效对未观测到的数据进行建模
  • BPR 作为配对算法,只需关注已观测数据及其关系,从而能够对用户喜好,特别是**隐反馈(Implicit Feedback)**数据,取得更明显效果。
  • 隐反馈的定义:并非用户明确告知系统对每个物品的喜好程度,而是用户在与系统交互过程中通过行为(如浏览、点击、购买)表达出的喜好。这类行为往往不全面,需要算法和模型进行有效建模。

三、论文主要贡献与核心方法

3.1 问题背景

  • BPR 的核心是学习配对排序问题:训练时需要对一个正例 + 一个负例的配对进行学习并更新参数。
  • 在自然的用户隐反馈数据集中,正例是少数、负例是绝大多数
  • 传统方法:组成配对时,相对一个正例,均匀地(Uniformly)选取负样本组成配对,该过程称为「采样(Sampling)」。

3.2 两大主要贡献

  1. 发现全局均匀采样的弊端:如果从全局均匀地采样负样本,第一没有必要,第二可能反而影响最终学习效果。
  2. 提出面向电子商务的负样本采样方法:让学习算法利用更多用户的「浏览(View)」信息,从而大幅提升整体训练效果。

3.3 核心方法

实验一:缩减负样本采样空间
  • 不从全局选取负样本,仅采样极小一部分(例如几百个负样本而非几万个)。
  • 实验结果:
    • 贝贝网:精确度不仅未受影响,反而有所提升;
    • 天猫:效果无提升、有轻微下降,但作者认为代价值得------数据集减少使训练时间大幅降低
  • 结论:不需要从全局进行采样
实验二:用户行为分集采样

将用户数据划分为三个集合:

集合 含义
C1 购买集(发生过购买行为)
C2 浏览但没有购买集
C3 剩下的数据
  • 作者提出:BPR 要达到最好效果,需要对三种数据集进行采样,即组成 C1-C2、C1-C3、C2-C3 的配对来学习。
  • 采样比例经验:总体上 C3 中采样的数据 > C2 > C1------即训练算法要更好地学习用户「不喜欢某件东西」的偏好。
  • 最终效果:采用该采样方式后,模型效果比传统 BPR 或仅使用「最流行的物品」作为推荐结果提升约 60%

四、实验数据集

数据集 用户数 商品数 购买次数 浏览次数 稀疏度
贝贝网(母婴产品) 约 16 万 12 万 260 万次 4600 万次 > 99%
天猫 3 万 3 万余 46 万次 150 余万次 > 99%

五、要点回顾

  1. 从高维度理解 BPR:一种基于隐反馈的配对排序学习算法;
  2. 论文主要贡献与思路:改进负样本采样策略(缩减采样空间 + 分集采样),充分利用浏览数据;
  3. 实验成果:训练效率显著提升,推荐效果相对传统 BPR 提升约 60%。

六、参考文献

  1. Steffen Rendle, Christoph Freudenthaler, Zeno Gantner, and Lars Schmidt-Thieme. BPR: Bayesian personalized ranking from implicit feedback. Proceedings of the Twenty-Fifth Conference on Uncertainty in Artificial Intelligence (UAI '09). AUAI Press, Arlington, Virginia, United States, 452-461, 2009.
相关推荐
IZero073 小时前
Elasticsearch 学习笔记筑基-文档操作篇
笔记·学习·elasticsearch
公爵爱学习3 小时前
安装Ubuntu20.04遇到的问题 简要简述笔记
笔记
Wang's Blog5 小时前
PostgreSQL笔记28: PostgreSQL ACID 特性与实现机制深度解析
大数据·笔记·postgresql
u0103055275 小时前
正则表达式find与matches区别详解
笔记
浪兎兎5 小时前
Nginx 笔记
运维·笔记·nginx
_Narcissus_6 小时前
二分算法笔记及例题
数据结构·c++·笔记·算法·蓝桥杯·查找·二分算法
Hammer_Hans6 小时前
DFT笔记112
笔记
FAREWELL000756 小时前
学习笔记-热更新导航
笔记·学习
苏子寒8 小时前
Nano-VLLM全代码解析笔记(6)-embed_head和linear
pytorch·笔记·python·机器学习·ai·nlp·vllm
雨田言炎8 小时前
STM32专题之内部FLASH详解
笔记·stm32·单片机