摘要
知识问答类社区的推荐场景与电商、短视频有显著差异:内容以图文为主,用户兴趣偏长尾,新用户占比高,行为稀疏且决策周期长。本文结合我们在亿级规模推荐系统中的实践,讨论新用户冷启动、用户长短期兴趣建模、多目标排序、图模型召回等方向的技术挑战与解决思路,供同行参考。
- 场景特点与核心问题
知识社区的内容消费有几个鲜明特点:
内容非标且长尾:同一问题下有大量回答,质量参差不齐,用户兴趣分散;
用户行为稀疏:大量用户以浏览为主,点赞、评论、收藏等强行为占比低;
新用户占比高:每天有大量未登录或新注册用户进入推荐流,缺乏历史行为;
兴趣漂移明显:用户可能因某个热点问题进入,随后兴趣快速转移。
这些特点决定了,直接照搬电商或短视频的推荐方案,效果会打折扣。我们重点在以下几个方向做了迭代。
- 新用户冷启动:从"猜"到"推理"
新用户没有行为序列,传统做法是推热门内容,但热门内容竞争激烈,且无法体现个性化。我们的思路是:
利用注册与设备信息:在合规前提下,使用注册渠道、机型、地域等粗粒度特征做初始兴趣推断;
跨域迁移:将用户在站外或同集团其他产品上的行为,通过迁移学习映射到当前场景;
探索与利用平衡:在新用户前几次会话中,主动插入少量探索性内容,快速收集反馈,再切换到利用阶段。
实践中,我们将新用户7日留存作为核心指标,通过冷启动策略优化,取得了可观的提升。
- 用户长短期兴趣建模
用户兴趣既有长期稳定的偏好,也有短期突发的关注。我们采用双通道建模:
长期兴趣:基于用户历史行为序列,使用Transformer或GRU提取长期兴趣向量,更新频率较低;
短期兴趣:基于最近N次会话行为,使用实时序列建模,捕捉即时意图;
兴趣融合:通过门控机制或注意力网络,动态决定长期与短期兴趣的权重。
在特征工程上,我们引入了时间衰减、行为类型加权、内容主题分布等,让模型能更好地区分"一直喜欢"和"最近想看"。
- 多目标排序与机制设计
推荐系统不能只看点击率,还要兼顾停留时长、互动率、内容多样性、作者生态等。我们采用多目标排序模型,同时预估CTR、时长、点赞、评论等目标,再通过融合公式得到最终排序分。
难点在于目标之间的跷跷板效应:提升点击率可能损害时长,增加互动可能降低多样性。我们的做法是:
使用MMOE或PLE结构,让不同目标共享底层特征,但拥有独立的专家网络;
引入动态权重,根据用户活跃度、内容供给情况调整各目标权重;
在重排阶段加入多样性打散和作者扶持策略,避免头部效应过强。
- 图模型与向量召回
知识社区的内容之间存在丰富的关联:问题-回答-用户-话题构成异构图。我们利用图神经网络(GNN)学习节点表示,用于召回和排序。
图构建:以用户、问题、回答、话题为节点,以浏览、点赞、关注、回答等为边;
图嵌入:使用GraphSAGE或GAT生成节点向量,捕捉高阶关联;
向量召回:基于用户向量和内容向量做近似最近邻检索,提升召回效率;
生成式召回:探索基于生成式模型的召回方法,提升长尾内容曝光。
- 工程落地中的挑战
亿级规模下,推荐系统面临高性能、高并发、高可用的要求:
特征实时性:用户行为序列需要实时更新,离线特征与在线特征必须保持一致;
模型推理延迟:精排模型复杂度高,需要在效果与延迟之间权衡;
A/B实验体系:完善的实验平台是算法迭代的基础,支持多实验并行与快速回滚。
- 总结与展望
知识社区的推荐系统,核心是在稀疏行为下精准理解用户兴趣,并平衡多方目标。我们仍在探索的方向包括:大模型在用户意图理解中的应用、多模态内容理解、以及更高效的实时序列建模。
敲敲门了,同志们
#机器学习 #推荐算法 #深度学习