"A Survey of User Lifelong Behavior Modeling: Perspectives on Efficiency and Effectiveness" 论文笔记

背景

用户终身行为建模(ULBM) 是指在严格的工业效率约束下,对超长且异构的用户行为序列进行建模的问题。在真实工业推荐系统中,用户终身行为序列呈现两个显著特征:

  • 超长序列(Ultra-long Sequences):在快手等大型视频平台上,用户每天可能产生数百次交互,终身行为序列长度可达 10⁵ 量级。如图 1(a) 所示,拥有超过 10,000 次历史交互的 1/3 用户,贡献了 95% 以上的总观看时长。

  • 异构行为(Heterogeneous Behaviors):用户交互包含多种行为类型,如点击、点赞、分享、评论等。如图 1(b) 所示,82.2% 的用户表现出五种以上的活跃行为类型。这些异构信号在意图强度、时间动态和语义含义上存在显著差异。

因为工业推荐系统面临着严格的效率约束(端到端延迟通常在几百毫秒内,每秒处理数十万查询),这使得在效率与效果之间取得平衡成为核心挑战。本文正式提出 效率-效果平衡(EEB) 作为 ULBM 研究的基本原则

核心概念

序列特征

工业推荐系统中,用户终身行为序列通常呈现两个显著特征:

  • 超长序列(Ultra-long Sequences):在快手等大型视频平台上,用户每天可能产生数百次交互,终身行为序列长度可达 10⁵ 量级。如图 1(a) 所示,拥有超过 10,000 次历史交互的 1/3 用户,贡献了 95% 以上的总观看时长。

  • 异构行为(Heterogeneous Behaviors):用户交互包含多种行为类型,如点击、点赞、分享、评论等。如图 1(b) 所示,82.2% 的用户表现出五种以上的活跃行为类型。这些异构信号在意图强度、时间动态和语义含义上存在显著差异。

效率-效果平衡(EEB)

对用户终生行为序列进行建模必须应对效率和效果之间固有的张力,我们将其形式化为效率-效果平衡(EEB) 。工业界的核心在于 ROI 的最大化,我们希望随着序列长度的增加,模型的收益(Revenue) 能持续增长,但计算**成本(Cost)**必须被压制在可控范围内

图 2 说明了 ROI 平衡点如何随 RPM 和 CPM 变化;随着用户行为序列变长,我们的目标是优化 ROI 平衡点向右移动。以效率为导向的优化主要针对 CPM,以有效性为导向的优化主要针对 RPM。平衡点向右移动意味着对成本的忍耐上线提高了,由图可知收益先大于成本后小于成本,两线交点就是 ROI 平衡点

RPM(Revenue per Mille) :每千次展示收入,效果优化的目标

CPM(Cost per Mille) :每千次展示成本,效率优化的目标

ROI(Return on Investment):定义为 RPM 与 CPM 的比值

效率优化

在工业级推荐系统中,用户终身行为序列通常包含数万甚至数十万条交互记录,在严格的时延和资源约束下,直接建模几乎不可行。为应对这一挑战,现有方法主要从两个互补方向提升效率:算法优化基础设施优化,从而降低部署成本,并在超长序列下保持 ROI 平衡

算法优化

工业界目前普遍采用先预处理、后编码的两阶段范式,算法优化主要分为基于搜索的方法和基于压缩的方法两种

(1) 基于搜索的方法

该类方法通过识别与当前推荐条件最相关的一小部分交互来预处理用户终生行为序列,从而大大减少下游建模的有效输入规模

核心思想: 遵循 SIM 引入的范式,基于搜索的方法通常由两个组件组成:全局搜索单元(GSU)精确搜索单元(ESU)。 GSU 从原始长序列中选择与指定条件最相关的 top-k 相互作用,从而生成长度显着减少的精炼子序列。然后,ESU 对此子序列执行细粒度兴趣建模,以生成用于排名的用户表示。它们按照不同的搜索策略主要分为以下四类:

  • Rule-based 例如 SIM,直接用商品类目 ID 等特征进行硬匹配

  • Vector Similarity 例如 TransAct V2,利用内积或余弦相似度在向量空间进行检索,搜索语义相关的行为

  • SimHash-based 例如 ETA,利用 SimHash 技术将物品向量转化为二进制编码,通过位运算和汉明距离快速计算相似度,实现了 GSU 与 ESU 的共同优化

  • Target Attention 例如 TWIN,通过解耦特征并引入缓存机制,使得在 GSU 阶段也能使用复杂的 Target Attention,解决了 GSU 与 ESU 目标不一致的问题

(2) 基于压缩的方法

鉴于搜索式方法在 ESU 中对历史信息覆盖有限,压缩式方法通过将超长用户行为序列转化为若干个兴趣向量,以实现全部历史信息的有效利用

核心思想: 先通过兴趣缩减单元(IRU) 将长序列转化为固定大小的若干兴趣向量,作为序列全部信息的高度浓缩;再通过**兴趣融合单元(IFU)**对 IRU 得到的兴趣表征进行融合,以得到最终的兴趣表征。它们按照不同的分区主要分为以下三类:

  • Rule-based 例如 ClimberHiT-LBM,将序列按照语义或时间分块,每一块单独建模得到对应的兴趣表征

  • Cluster-based 例如 ENCODETrinity,将序列聚类成若干个类别,每个类别用一个兴趣向量表示

  • Direct Compress 例如 VQLCHIME,通过离散码本压缩序列信息,相似语义的物品在不同粒度的码本上共享兴趣向量

(3) 总结

搜索式方法与压缩式方法各有取舍:前者依赖候选项进行条件化建模,能够获得更具针对性的精准兴趣表征,但在推理阶段需随候选重复计算;后者可以不依赖具体候选项,学习可多次复用的通用兴趣表示,但在刻画与候选项相关的细粒度兴趣上相对受限。鉴于二者在精度与效率上的互补性,近年来一些工作开始尝试将搜索式与压缩式方法相结合,如 TWIN V2DILN 等,以同时兼顾效果和效率,有效地平衡计算成本和丰富的用户兴趣表示,与 EEB 目标保持一致

基础设施优化

基础设施层面的优化不直接改变模型结构,却在训练稳定性、推理效率等方面对算法落地起着关键支撑作用

(1) 多级缓存机制

  • **Representation Cache:**缓存预处理后的用户兴趣向量。在大多数情况下,表示缓存用于存储基于压缩的方法中预处理阶段的输出,因为生成的用户兴趣表示独立于候选项目。这允许在在线推理期间跨多个候选项重用缓存的表示,从而显着提高服务效率。但是表示缓存也带来了局限性,缓存的兴趣可能会因更新延迟而变得过时,并且冷启动用户得不到很好的支持

  • **Parameter Cache:**存储 ULBM 中使用的参数例如 Attention 中的 K/V 以减少计算开销。本质上缓存的参数是与候选无关的,可以计算一次并重复使用多次,而不受候选项的影响。参数缓存通常应用于基于搜索的方法,因为预处理期间的子序列选择高度依赖于候选项,可以仅缓存与候选无关的参数

  • **Index Cache:**专为基于搜索的 ULBM 设计,通过缓存行为序列的聚类索引树,将搜索复杂度降至对数级

(2) 定制算子

通过融合多步计算并针对硬件特性进行优化,在不改变模型结构的前提下显著降低算子调用开销与推理时延

(3) 精度优化

在保证模型效果的前提下,采用 FP16 或 INT8/INT4 等低精度存储嵌入或训练中间层,以显著降低内存带宽压力

效果优化

本文从三个维度探讨效果优化的前沿方向:宏观序列建模微观兴趣理解外部知识引入。这些方法协同作用,不断提升模型效果,同时在超长序列下维持 ROI 平衡

宏观序列建模

(1) 聚合编码器

早期方法受限于计算资源,只能处理百级别长度的行为序列,因此主要采用池化、目标注意力等轻量聚合方式学习用户兴趣。代表方法如 DIN 利用 Target Attention 根据目标物品动态聚合历史行为,DIEN 则进一步利用 GRU 建模兴趣演化过程。这些聚合机制奠定了后续 ULBM 中兴趣编码器(Interest Encoder)的基本设计范式

(2) 长上下文编码器

随着两阶段 ULBM 范式的发展,研究重点从如何筛选长序列 转向如何充分利用筛选后的上下文 。因此,引入 Transformer、跨行为交互以及多模态信息成为主流。MUSE 利用文本、图像等多模态信息增强长期兴趣表示,Climber 进一步设计自适应 Transformer,根据不同用户行为动态调整编码方式,提高长上下文建模能力

(3) 可扩展编码器

两阶段方法虽然降低了计算成本,但不可避免地丢失部分历史信息。因此,近年来研究开始探索直接对完整超长序列进行端到端建模LONGER 结合多种注意力机制,在计算预算内扩大可建模长度;HSTU 则重新设计样本组织方式和注意力结构,使 Transformer 能够支持万级以上行为序列,进一步提升超长上下文建模能力

(4) 总结

二阶段范式下的长上下文编码器是目前最成熟的 ULBM 方案,在多个工业场景中取得了显著效果。然而,随着对建模精度的要求不断提高,端到端可扩展编码器的使用正成为未来趋势,但其在处理万级及以上超长序列时仍面临实际部署的挑战

微观兴趣理解

(1) 多行为建模

传统方法通常将不同类型行为统一建模,而实际点击、收藏、购买等行为具有不同语义和意图。因此,多行为建模开始显式刻画行为之间的关系。MB-GMN 利用 GNN 建模异构行为之间的信息传播,而 CMBR 则进一步采用条件化 Token,将行为类型和场景信息融入表示学习,在保持建模能力的同时更加轻量,适合工业级超长序列部署

(2) 多兴趣建模

随着用户兴趣日益多样,仅用单一兴趣向量已难以刻画长期偏好,因此研究开始学习多个兴趣子空间及其演化过程。DiffuMIN 利用扩散模型生成更加准确的兴趣表示,提高兴趣提炼能力;ReaRec 则引入自回归推理,逐步更新兴趣表示,更好地捕捉长期兴趣演化路径

(3) 序列去噪

超长行为序列中包含大量误触、偶然点击等噪声行为,直接建模容易干扰长期兴趣学习。因此,去噪方法通过自监督学习或行为质量评估筛除低价值行为。典型方法 END4Rec 能够自动识别噪声交互,使模型更加关注稳定且具有代表性的长期兴趣

(4) 序列生成

在去噪基础上,进一步有工作尝试主动构造高价值行为序列 ,弥补原始数据不足。COFFEE 利用语义交互生成更加丰富的用户行为序列,增强兴趣表达;DR4SR 则采用数据蒸馏生成训练样本,提高模型的泛化能力和鲁棒性。尽管生成方法效果突出,但计算成本和推理延迟仍限制其工业部署

外部知识引入

(1) 知识图谱

仅依赖行为序列容易受到数据稀疏限制,因此早期方法引入知识图谱补充物品间的语义关系。KGCLKMCLR 将用户行为图与知识图谱联合进行对比学习,把实体关系编码到用户表示中,在缓解稀疏性的同时提升推荐的可解释性

(2) 大语言模型

相比知识图谱,LLM 具备更丰富的开放世界知识和更强的推理能力,因此逐渐成为新的知识来源。目前主要形成三个发展方向:

  • LLM 语义编码: 将 LLM 作为语义编码器,把文本或多模态内容映射为高质量表示。DMGIN 利用多模态大模型对超长行为序列进行语义压缩,在保留关键信息的同时降低序列长度

  • LLM 信息选择: 将 LLM 作为信息过滤器,从长期行为中筛选最具价值的历史信息。ReLLaReLLaXMISS 利用上下文语义理解能力,对用户行为进行重要性筛选,为下游模型提供更加有效的输入

  • LLM 知识推理: 将 LLM 作为推理引擎,根据用户历史行为推断潜在兴趣和未来需求。LIBERRecZero 利用条件生成和推理能力直接建模深层用户偏好,使推荐逐步从模式匹配走向认知推理

(3) 总结

LLM 为 ULBM 提供了远超传统方法的语义表达与推理能力,但同时带来了计算成本、推理延迟以及幻觉等问题。因此,目前工业界更多采用 "语义编码 → 信息选择 → 知识推理" 逐步递进的应用方式,在效果提升与部署成本之间取得平衡。随着轻量化推理和模型压缩技术的发展,LLM 有望成为未来 ULBM 的重要基础能力

未来展望

(1) 跨阶段统一 ULBM

当前推荐系统普遍采用召回、粗排、精排等多阶段级联架构,各阶段通常独立建模用户终身行为,导致行为序列被重复编码,增加了计算开销和存储成本,也降低了整体 FLOPs 利用率。未来可探索跨阶段统一的 ULBM 框架 ,学习可在多个推荐阶段共享的通用用户兴趣表示,并结合轻量级任务适配实现阶段间复用,从而减少重复计算,提高系统整体效率。进一步结合跨阶段缓存、统一特征存储以及算子级优化,有望进一步提升工业推荐系统的 Model FLOPs Utilization (MFU),实现更高的部署收益

模型算力利用率(Model FLOPs Utilization,MFU) :模型一次前反向计算消耗的矩阵算力与机器算力的比值

硬件算力利用率(Hardware FLOPs Utilization,HFU):考虑重计算后,模型一次前反向计算消耗的矩阵算力与机器算力的比值

(2) 大语言模型增强 ULBM

大语言模型具备丰富的世界知识、强大的语义理解能力和推理能力,为超长行为建模提供了新的可能。相比传统方法仅依赖历史行为,LLM 能够结合文本、多模态内容和外部知识,更准确地理解用户兴趣,并完成语义压缩、行为筛选和兴趣推理等复杂任务。未来的发展方向不仅是将 LLM 作为语义编码器,更重要的是探索LLM 与推荐模型的协同建模,充分发挥其知识推理和泛化能力,在保证工业部署效率的前提下提升长期兴趣建模效果。同时,模型轻量化、推理加速、幻觉抑制以及可控推理等问题仍然是 LLM 在 ULBM 落地过程中需要重点解决的挑战

相关推荐
王小王-1232 个月前
基于推荐算法的 B 站短视频数据分析及推荐系统设计与实现
推荐系统·b站·b站短视频推荐系统·短视频数据分析·短视频评论·b站评论分析·弹幕评论分析
绵满2 个月前
"TokenFormer: Unify the Multi-Field and Sequential Recommendation Worlds" 论文笔记
大模型·推荐系统
绵满2 个月前
Vector Quantization for Recommendation 笔记
推荐系统·基础知识
绵满2 个月前
"Sample Is Feature: Beyond Item-Level, Toward Sample-Level Tokens for Unified Large Recommender Models" 论文笔记
大模型·推荐系统
hongjianMa3 个月前
【论文阅读】Structured Spectral Reasoning for Frequency-Adaptive Multimodal Recommendation
论文阅读·python·深度学习·推荐系统·多模态推荐
绵满3 个月前
"MixFormer: Co-Scaling Up Dense and Sequence in Industrial Recommenders" 论文笔记
大模型·推荐系统
爱喝雪碧的可乐3 个月前
2026 腾讯广告算法大赛优秀方案启示:行为条件化多模态自回归生成推荐摘要
算法·数据挖掘·回归·推荐系统·推荐算法
绵满3 个月前
"HyFormer: Revisiting the Roles of Sequence Modeling and Feature Interaction in CTR Prediction" 论文笔记
大模型·推荐系统
绵满3 个月前
"OneTrans: Unified Feature Interaction and Sequence Modeling with One Transformer in Industrial Recommender" 论文笔记
大模型·推荐系统