阅读笔记
论文信息
- 标题:A Path-constrained Framework for Discriminating Substitutable and Complementary Products in E-commerce
- 会议:WSDM 2018(最佳学生论文)
- 团队:京东数据科学实验室
作者群背景
- 任昭春(Zhaochun Ren):京东数据科学实验室高级研发经理,2016年荷兰阿姆斯特丹大学计算机博士毕业,师从信息检索权威 Maarten de Rijke,在信息检索、文字归纳总结、推荐系统等领域发表多篇论文。
- 汤继良(Jiliang Tang):密歇根州立大学助理教授,2015年亚利桑那州立大学博士毕业,师从数据挖掘专家刘欢(Huan Liu),已发表70多篇论文,引用超4000次,是数据挖掘领域的华人学术新星。
- 殷大伟(Dawei Yin):京东数据科学实验室高级总监,2013年里海大学计算机博士毕业,师从 Davison 教授,此前在雅虎研究院担任研究科学家和高级经理。
论文的核心问题
工业级商品推荐系统通常分两步:产生候选集(从海量商品中选出几百到几千款)→ 用复杂机器学习模型排序。本文聚焦于候选集生成环节,研究如何更好地挖掘两类关键商品关系:
- 替代品(Substitutes):用户认为可以互相替换的商品
- 互补品(Complements):用户倾向于一起购买的商品
这两类关系的挖掘对推荐候选集生成和特定场景推荐(如用户已购买某商品后推荐互补品)都有重要价值。
面临的核心难点
- 数据稀疏问题:替代/互补关系涉及至少两个商品,而绝大多数商品对从未被同时考虑或购买过。
- 关系复杂性:同一商品在不同场景下可能既扮演替代品也扮演互补品角色,不能静态看待。
论文的两大贡献
- 提出**"多关系学习"(Multi-Relation Learning)框架**来同时挖掘替代品和互补品。
- 引入**两种"路径约束"(Path Constraints)**来缓解数据稀疏问题,用人工规则(模糊逻辑形式化)扩大现有数据的影响力。
核心方法
第一步:基于 Word2Vec 的商品表征学习
将商品间所有关系(不管替代还是互补)视为正相关,其余商品视为负相关,用 Word2Vec 思想训练商品向量,使得正相关商品向量点积较高、负相关较低。这一步得到一个综合表征。
第二步:关系特定的投影
综合表征是粗粒度的,无法区分不同场景下的关系属性。方法是为每种关系类型学习一个投影向量,将全局表征投影到关糷特定的子空间,得到每个商品在特定关系下的表征。
第三步:模糊逻辑约束
使用**模糊逻辑(Fuzzy Logic)**将硬逻辑关系转换为软逻辑关系(概率形式),从而用一系列人工定义的规则来解决数据稀疏问题。例如:
- 若商品A是商品B的替代品,则A所在类别很可能也是B所在类别的替代品
- 若A替代B、B替代C,且A/B/C同类,则C也可视为A的替代品
这些规则不保证100%正确,因此用软逻辑(概率形式)建模,避免硬约束带来的误判。
最终优化目标
模型的最终目标函数集成了三个组件:商品综合表征 → 关系特定投影学习 → 软逻辑关系学习,三者联合优化。
实验效果
使用京东商城五大类商品数据进行实验(规模远超此前亚马逊公开数据集),对比了加州大学圣地亚哥团队的模型、多个矩阵分解经典模型以及基于协同过滤的模型。结果表明本文提出的模型在关系预测子任务和最终排序任务上均大幅优于对比模型,且逻辑关系约束有效帮助区分替代关系和互补关系。
小结
本文通过多关系学习框架和模糊逻辑路径约束,有效解决了电商场景下替代品与互补品挖掘中的数据稀疏与关系复杂性两大难题。核心思路值得借鉴:用 Word2Vec 做商品表征的冷启动,用投影机制解耦多面关系,再用软逻辑规则注入领域先验知识、缓解稀疏问题。