Meta-SlimPer:固定知识库重构个性化排序

论文信息

论文标题:SlimPer: Make Personalization Model Slim and Smart

论文链接:https://arxiv.org/abs/2607.12281v1

论文作者:Siqi Wang、Xianjie Chen、Shaofeng Deng、Albert Chen、Romil Shah、Jiawei Huang、Zhaoqin Wang、Zhang Zhang、Yiqun Liu、Meilei Jiang、Anish Dubey、Moyan Mei、Tongxin Wang、Nathan Berrebbi、Misael Manjarres、Armand Sauzay、Shardul Kothapalli、Aryaman Vinchhi、Kevin Johnstone、Juheon Lee、Gufan Yin、Ziheng Huang、Justin Lin、Mert Terzihan、Yilin Qi、Cynthia Yang、Colin Peppler、Qi Ding、Ruohan Sun、Ge Song、Litao Deng、Parichay Kapoor、Matt Ma、Huihui Cheng、Jiyuan Zhang、Yanli Zhao、Yiping Han、Fangqiu Han、Ning Yao、Arun Singh、Jordan Edwards、Zhengyu Su、Abhishek Kumar、Guangdeng Liao、Ankit Asthana;机构:Meta Platforms, Inc.

一句话总结:SlimPer 把推荐排序从"长序列 Transformer 表征传播"改写成"固定大小用户-物品知识库的多轮检索、匹配与更新",在每层直接访问 10k+ 用户侧原始 token,用更低显存和 FLOPs 换到更好的 Instagram Reels 与 Feed 排序效果。

核心读法: SlimPer 的关键不只是把注意力复杂度降到线性,而是把每一层的计算容量从"用户历史 token 之间互相混合"转向"用户侧证据与候选物品相关性的显式匹配"。

背景与动机

工业推荐排序模型要在实时成本约束下,对同一个用户的一批候选 item 输出多个 engagement 目标的相关性分数。输入通常混合三类信息:高基数稀疏特征、连续 dense 特征、用户历史事件序列。现有系统常把不同模态拆给专门组件处理,例如用 HSTU 建模长历史序列、用 Wukong 建模固定大小稀疏和 dense 特征,再做浅层融合。

论文指出,近年的 Transformer 化推荐模型沿用了生成式语言模型的结构假设:每个 token 位置都有自回归监督,因此网络需要在每层维护随序列长度增长的大中间张量。推荐排序没有 token 级预测目标,它只需要给每个用户-物品 pair 产出一组 relevance scores。把语言模型式的全 token 表征传播照搬到推荐,会形成两难:压缩中间表征会丢细粒度历史信息,保留长序列中间张量又会带来显存和计算开销。

SlimPer 的核心 insight 是:判别式推荐更适合维护一个固定大小的用户-物品知识库,让它在每层主动查询完整用户侧证据、做显式相关性匹配,再更新知识库。这样模型深度不再随用户历史长度线性增加显存负担,且每层仍可直接访问原始历史事件。

信息模态 输入类型 代表信号
Sparse 高基数类别 ID 用户兴趣摘要,例如高互动作者、类目、兴趣标签;信号粗粒度但稳定。
Sequence 结构化用户行为记录 内容消费、停留时长、互动类型、时间戳等细粒度行为,提供高分辨率时间信息。
Dense 连续数值 用户统计量、item 质量指标、时间与设备等上下文属性。

整体架构

SlimPer 的总体流程是:原始 sparse、dense 与用户历史事件先被 tokenization 模块转成统一维度 token;非用户侧 token 初始化固定大小知识库;每个 SlimPer layer 执行 Select、Match、Refine 三步;多层迭代后,对每个预测任务输出 task embedding,再线性投影成 logits。

端到端数据流可以写成:输入候选集合与用户侧多模态特征 → 多模态 tokenization → 初始化知识库 X^0 → 第 k 层从完整用户侧 token 中选择证据 → 用模板做显式 dot-product matching → 更新 X^{k+1} → 聚合各层任务表示输出多任务分数。论文生产实验中常用 5 到 10 层 SlimPer layer,知识库大小 K=64,隐藏维度 d=256,query slots q=16,template slots t=32

架构边界: SlimPer 不是把长序列压成一次性 summary 后再排序;每一层都重新访问完整用户侧 token,因此早层可抓宽泛兴趣,后层可收窄到近期关键行为。

逐模块方案拆解

3.1 问题定义与知识库初始化

模块作用:把推荐排序表述为多任务打分函数,并用非用户侧输入初始化固定大小的用户-物品知识库。

输入:候选集合 I={i_1,...,i_C},sparse 特征集合 S,dense 特征集合 D,用户事件序列 E;输出:每个候选 item 的 τ 个任务分数。

f ( u , i ; S , D , E ) → R τ f(u,i; S,D,E) \rightarrow \mathbb{R}^{\tau} f(u,i;S,D,E)→Rτ

变量说明:

  • u:当前用户。

  • i:候选物品,i \in I

  • S:稀疏特征集合,包含用户侧、物品侧或交叉侧的高基数类别特征。

  • D:连续 dense 特征集合。

  • E:用户历史事件序列,长度记为 N

  • τ:多任务目标数量,例如 reshare、skip、like、comment、follow、save。

  • f:排序模型打分函数,输出维度为 τ

知识库初始化为:

X 0 = L ( S i n ) X^{0}=\mathcal{L}(S_{in}) X0=L(Sin)

变量说明:

  • X^0 \in \mathbb{R}^{B\times K\times d}:第 0 层用户-物品知识库,B 是 batch size,K 是知识库槽位数,d 是 embedding 维度。

  • S_{in}:非用户侧输入 token,通常来自 item-side 或 cross-side sparse features。

  • \mathcal{L}:segment-wise linear projection,把输入 token 投影成固定 K\times d 形状。

  • 论文实验中 K=64d=256;Feed 用 5 层,Reels 用 7 层。

3.2 多模态 Tokenization

模块作用:把 sparse、sequence、dense 三类原始特征转成 SlimPer layer 可共用的 token 表示。

输入:稀疏 ID、用户历史事件、dense 数值特征;输出:稀疏 token S、事件 token E、dense 表示 D

稀疏特征通过 embedding lookup 与 pooling 得到固定维度 token:

S j = P o o l ( e j , 1 , e j , 2 , . . . , e j , k ) S_j = \mathrm{Pool}(e_{j,1}, e_{j,2}, ..., e_{j,k}) Sj=Pool(ej,1,ej,2,...,ej,k)

变量说明:

  • S_j \in \mathbb{R}^{d}:第 j 个稀疏特征域的 token。

  • e_{j,r} \in \mathbb{R}^{d}:第 j 个特征域中第 r 个取值的 embedding。

  • k:该特征域内被 pooling 的取值个数。

  • Pool:均值或求和 pooling。

  • 拼接全部稀疏域后得到 S \in \mathbb{R}^{B\times M_s\times d}

用户历史事件 token 融合内容、互动类型、时间和上下文:

E ( t ) = M L P E s ( e s p a r s e ( t ) ) + e t e m p o r a l ( t ) + M L P E e ( e t y p e ( t ) ) + e c o n t e x t ( t ) E^{(t)} = \mathrm{MLP}^{s}{E}(e^{(t)}{sparse}) + e^{(t)}{temporal} + \mathrm{MLP}^{e}{E}(e^{(t)}{type}) + e^{(t)}{context} E(t)=MLPEs(esparse(t))+etemporal(t)+MLPEe(etype(t))+econtext(t)

变量说明:

  • E^{(t)} \in \mathbb{R}^{d}:第 t 个用户历史事件的 token。

  • e^{(t)}_{sparse}:事件 item 的内容侧稀疏 embedding 拼接或 pooling 后的表示。

  • e^{(t)}_{type}:事件类型编码,覆盖显式行为和隐式行为,例如 like、reshare、long watch、watch time bucket。

  • e^{(t)}_{temporal}:时间编码,由位置编码与 delta-time 编码相加。

  • e^{(t)}_{context}:围绕第 t 个事件的局部上下文编码。

  • \mathrm{MLP}^{s}_{E}\mathrm{MLP}^{e}_{E}:把内容侧和行为类型侧表示投影到统一维度 d

  • 全部事件组成 E \in \mathbb{R}^{B\times N\times d}N 是历史事件长度。

上下文编码用局部窗口提取邻近事件信息:

e c o n t e x t ( t ) = Ψ c o n t e x t ( x t − w + 1 , . . . , x t ) e^{(t)}{context}=\Psi{context}(x_{t-w+1},...,x_t) econtext(t)=Ψcontext(xt−w+1,...,xt)

变量说明:

  • e^{(t)}_{context} \in \mathbb{R}^{d}:第 t 个事件的上下文表示。

  • \Psi_{context}:上下文编码函数,论文尝试 CNN、滑窗 attention,以及二者组合。

  • w:窗口大小。

  • x_t:第 t 个事件收集到的信息。

Dense 特征直接拼接后进入 MLP:

D = M L P ( C o n c a t ( d 1 , d 2 , . . . , d m D ) ) D=\mathrm{MLP}(\mathrm{Concat}(d_1,d_2,...,d_{m_D})) D=MLP(Concat(d1,d2,...,dmD))

变量说明:

  • D:dense 特征投影后的表示,论文描述为 fixed-size vector,例如约 1024 维。

  • d_r:第 r 个 dense 数值特征。

  • m_D:dense 特征数量。

  • \mathrm{MLP}:带 SiLU 激活的多层感知机。

3.3 Step 1:All-Modality-Aware Token Selection

模块作用:用当前知识库生成 query,从完整用户侧 token 中选择与当前用户-物品上下文相关的证据。

输入:第 k 层知识库 X^k、稀疏 token S、序列 token E;输出:稀疏侧选择结果 R_s 与序列侧选择结果 R_e

Q = L ( X k ) , Q ∈ R B × q × d Q=\mathcal{L}(X^k), \quad Q\in \mathbb{R}^{B\times q\times d} Q=L(Xk),Q∈RB×q×d

变量说明:

  • X^k \in \mathbb{R}^{B\times K\times d}:第 k 层知识库。

  • Q \in \mathbb{R}^{B\times q\times d}:从知识库派生出的 query slots。

  • q:query 槽位数,论文实验取 q=16

  • \mathcal{L}:segment-wise linear projection。

通用 attention 聚合写成:

R = Φ ( Q , K ) V R=\Phi(Q,K)V R=Φ(Q,K)V

变量说明:

  • R:attention 输出,承载从用户侧 token 中选出的证据。

  • Q:由知识库生成的查询。

  • KV:用户侧 token 作为 key 和 value,论文实现中直接使用原始 token,未额外投影。

  • \Phi(Q,K):attention kernel,针对不同模态采用不同形式。

对固定大小 sparse tokens,论文使用轻量 MLP kernel;对可变长序列 tokens,使用 scaled dot-product kernel:

Φ ( Q , K ) = { M L P ( C o n c a t ( L ( Q ) , L ( K ) ) ) , sparse features S o f t m a x ( γ Q K T ) , sequence features \Phi(Q,K)= \begin{cases} \mathrm{MLP}(\mathrm{Concat}(\mathcal{L}(Q),\mathcal{L}(K))), & \text{sparse features} \\ \mathrm{Softmax}(\gamma QK^T), & \text{sequence features} \end{cases} Φ(Q,K)={MLP(Concat(L(Q),L(K))),Softmax(γQKT),sparse featuressequence features

变量说明:

  • \Phi(Q,K):产生 attention weights 的核函数。

  • \mathcal{L}(Q)\mathcal{L}(K):对 query 和 key 的线性投影。

  • \gamma:softmax temperature。

  • sparse 分支的 token 数固定,用 parametric MLP 足够轻量。

  • sequence 分支长度为 N,采用非参数 scaled dot-product attention。

两路 token 选择结果为:

R s = Φ s ( Q , S ) S , R s ∈ R B × q × d R_s=\Phi_s(Q,S)S, \quad R_s\in\mathbb{R}^{B\times q\times d} Rs=Φs(Q,S)S,Rs∈RB×q×d

R e = Φ e ( Q , E ) E , R e ∈ R B × q × d R_e=\Phi_e(Q,E)E, \quad R_e\in\mathbb{R}^{B\times q\times d} Re=Φe(Q,E)E,Re∈RB×q×d

变量说明:

  • R_s:从稀疏用户侧 token 中取回的证据。

  • R_e:从历史事件序列中取回的证据。

  • \Phi_s:sparse attention kernel。

  • \Phi_e:sequence attention kernel。

  • S \in \mathbb{R}^{B\times M_s\times d}:稀疏 token 集合。

  • E \in \mathbb{R}^{B\times N\times d}:序列 token 集合。

3.4 Step 2:显式多面向相关性匹配

模块作用:从知识库生成一组 matching templates,将取回的证据与模板做 dot-product,得到可解释的相关性分数。

输入:第 k 层知识库 X^k、选择结果 R_sR_e;输出:稀疏侧和序列侧 matching scores。

T = L ( X k ) , T ∈ R B × t × d T=\mathcal{L}(X^k), \quad T\in\mathbb{R}^{B\times t\times d} T=L(Xk),T∈RB×t×d

变量说明:

  • T:多面向 matching templates。

  • t:template 槽位数,论文实验取 t=32

  • X^k:当前用户-物品知识库。

  • \mathcal{L}:线性变换,将 K 个知识库槽位映射为 t 个 template。

相关性匹配采用显式 dot-product:

λ s = D o t P r o d u c t ( R s , T ) , λ s ∈ R B × q × t \lambda_s=\mathrm{DotProduct}(R_s,T), \quad \lambda_s\in\mathbb{R}^{B\times q\times t} λs=DotProduct(Rs,T),λs∈RB×q×t

λ e = D o t P r o d u c t ( R e , T ) , λ e ∈ R B × q × t \lambda_e=\mathrm{DotProduct}(R_e,T), \quad \lambda_e\in\mathbb{R}^{B\times q\times t} λe=DotProduct(Re,T),λe∈RB×q×t

变量说明:

  • \lambda_s:稀疏证据与 templates 的相关性矩阵。

  • \lambda_e:历史事件证据与 templates 的相关性矩阵。

  • R_s, R_e \in \mathbb{R}^{B\times q\times d}:Step 1 输出的两路证据。

  • T \in \mathbb{R}^{B\times t\times d}:由当前知识库生成的模板。

  • dot-product 沿 d 维计算,所以输出维度为 q\times t

3.5 Step 3:Refine Knowledge Base

模块作用:把匹配分数、当前知识库投影和 dense 特征拼接后,更新固定大小知识库。

输入:\lambda_s\lambda_eX^kD;输出:下一层知识库 X^{k+1}

X k + 1 = X k + M L P μ ( C o n c a t ( R M S N o r m ( λ s ) , R M S N o r m ( λ e ) , L ( X k ) , D ) ) X^{k+1}=X^k+\mathrm{MLP}_{\mu}(\mathrm{Concat}(\mathrm{RMSNorm}(\lambda_s),\mathrm{RMSNorm}(\lambda_e),\mathcal{L}(X^k),D)) Xk+1=Xk+MLPμ(Concat(RMSNorm(λs),RMSNorm(λe),L(Xk),D))

变量说明:

  • X^{k+1} \in \mathbb{R}^{B\times K\times d}:更新后的知识库。

  • X^k \in \mathbb{R}^{B\times K\times d}:更新前知识库,残差连接保留已有用户-物品理解。

  • \lambda_s,\lambda_e \in \mathbb{R}^{B\times q\times t}:两路相关性矩阵。

  • \mathrm{RMSNorm}:Root Mean Square Layer Normalization,用于稳定 matching score 尺度。

  • \mathcal{L}(X^k):当前知识库的线性投影。

  • D:dense 特征表示,被直接拼接进更新过程。

  • \mathrm{MLP}_{\mu}:知识库更新网络。

每层还可以输出 task embedding:

P p k = M L P p ( L ( X k ) ) , p ∈ 1 , τ P^k_p=\mathrm{MLP}_p(\mathcal{L}(X^k)), \quad p\in1,\\tau Ppk=MLPp(L(Xk)),p∈1,τ

变量说明:

  • P^k_p:第 k 层对第 p 个任务的任务表示。

  • p:任务索引。

  • τ:预测任务数量。

  • \mathrm{MLP}_p:任务 p 对应的投影网络。

  • 多层 P^k_p 可以求和后做 final linear projection 得到 logits。

3.6 ROO-Aware 设计

模块作用:利用同一请求内多个候选 item 共享用户侧特征的事实,只计算一份用户侧 token,并在候选 item 间共享。

在训练和推理中,同一个用户通常要同时排序多个候选 item。SlimPer 把 user-side features 与 item-side features 显式分开,所有用户侧 token 在 request batch 内只 tokenization 一次,再被该请求里的所有候选复用。相比把用户历史 token 复制到每个候选 item 上,ROO-Aware 设计直接降低冗余显存与计算。

复杂度上,论文给出的核心对比是:Transformer-like 方案在堆叠层里维护 N 级中间表征,且常含 N^2 级 self-attention;SlimPer 的层内用户-物品交互复杂度集中在 K\times N,其中 K 固定且远小于长历史 N

模型类型 Tokenization 成本 堆叠层成本 用户-物品交互容量
Conventional DLRM Memory/Compute:O(N) Memory:O(L·64);Compute:O(L·16) O(L·N·64)
ROO-aware Transformer-like Memory/Compute:O(N/B) Memory/Compute:约 O(L·(N/B+1)^2/B) O(L·N)
Non-ROO-aware Transformer-like Memory/Compute:O(N) Memory/Compute:约 O(L·N^2) O(L·N)
Sub-quadratic Transformer-like Memory/Compute:O(N) Memory/Compute:O(L·N) O(L·N)
SlimPer Memory/Compute:O(N/B) Memory:O(L·K);Compute:O(L·K·N·q) O(L·N·K)

训练目标 / 损失函数

论文主实验使用 Instagram final-stage ranking 的生产训练和评估数据,训练配置保持与 baseline 一致。文中明确给出离线评估指标 Normalized Entropy,而没有展开多任务训练 loss 的完整加权形式。由于 NE 是用 binary cross-entropy loss 标准化得到,可以把它视为对各 engagement 二分类任务 BCE 的归一化评估口径。

N E k = B C E l o s s ( y ^ ( k ) , y ( k ) ) − p k ln ⁡ ( p k ) + ( 1 − p k ) ln ⁡ ( 1 − p k ) NE_k=\frac{\mathrm{BCEloss}(\hat{y}^{(k)},y^{(k)})}{-p_k\\ln(p_k)+(1-p_k)\\ln(1-p_k)} NEk=−pkln(pk)+(1−pk)ln(1−pk)BCEloss(y^(k),y(k))

变量说明:

  • NE_k:第 k 个任务的 Normalized Entropy,数值越低越好。

  • \hat{y}^{(k)}:模型对第 k 个任务的预测概率。

  • y^{(k)}:第 k 个任务的真实二分类标签。

  • \mathrm{BCEloss}:二元交叉熵损失。

  • p_k:第 k 个任务在样本中的全局正例率。

  • 分母是用全局正例率作为朴素预测器时的 BCE,用于消除不同任务 base rate 差异。

论文经验口径中,约 0.03% 的 NE improvement 已被认为具有 empirical significance。文中报告的 NE 变化均相对 surface-specific baseline,负数表示更好。

实验与分析

5.1 实验设置

Baseline 是 Instagram 现有 final-stage ranking 模型,采用 late-fusion 架构:HSTU 建模可变长用户历史序列,Wukong 建模固定大小 sparse/dense 特征。SlimPer 与 baseline 使用相同训练和评估日期范围,optimizer、特征集等设置保持一致。论文在 Reels 与 Feed 两个主要排序场景上做离线评估,并将 Reels 5k events、Feed 4k events 版本推进到全量线上。

超参数 Feed Reels
SlimPer 层数 L 5 7
知识库大小 K 64 64
隐藏维度 d 256 256
Query slots q 16 16
Template slots t 32 32

5.2 离线主结果

SlimPer 在 Reels 和 Feed 的代表性任务上均取得 NE 改善。相同序列长度下,SlimPer 同时带来 NE win 与 QPS win;当序列长度增大时,NE win 继续放大,但长序列版本会付出一定 QPS 回退。

Surface 配置 reshare NE skip NE like NE comment NE follow NE save NE QPS Memory
Reels Baseline 2k events 0.00 0.00 0.00 0.00 0.00 0.00 0.00 0.00
Reels SlimPer 2k events -0.51 -0.31 -0.23 -0.41 -0.35 -0.35 +11.0 -9.32
Reels SlimPer 5k events -0.80 -0.57 -0.49 -0.64 -0.53 -0.62 -10.0 +4.59
Feed Baseline 1k events 0.00 0.00 0.00 0.00 0.00 0.00 0.00 0.00
Feed SlimPer 1k events -0.49 -0.28 -0.54 -0.52 -0.71 -0.62 +12.5 -18.12
Feed SlimPer 4k events -0.94 -0.52 -0.91 -0.94 -1.00 -1.05 -16.07 +2.04

Feed reshare 的 NE improvement 从 1k 的 -0.49% 增至 4k 的 -0.94%,接近 2 倍质量收益,但 QPS 从 +12.5% 变为 -16.07%。这说明 SlimPer 允许系统把更长历史引入最终排序,代价曲线比 quadratic baseline 更可控。

5.3 质量与效率缩放

在 Reels 场景,2k 长度下 SlimPer 相对 baseline 的 reshare NE 为 -0.51%,同时 QPS +11% 且 memory 下降。序列长度拉到 6k 时,SlimPer 达到 -0.86% NE,QPS 回退低于 20%;baseline 在更长序列下只有 -0.13% NE,QPS 回退 48%。论文把这个差异归因于计算容量分配:SlimPer 每层计算 K×N 的知识库到 token 相关性,而不是把大量计算花在用户侧 token 两两混合上。

FLOPs 估计也支持这个结论。

序列长度 Baseline HSTU GFLOPs SlimPer GFLOPs 比例
2048 约 24 约 3 约 8×
4096 约 74 约 5 约 16×
6144 约 150 约 6 约 25×

5.4 消融实验

知识库大小 K 控制信息瓶颈容量。以 Reels SlimPer 5k events、K=64、7 层为 baseline,减小 K 会提升 QPS 与降低显存,但 NE 变差。K=64 被论文选择为质量与效率的平衡点。

K, q, t NE QPS Memory Diff
64,16,32 0.00 0.00 0.00
4,1,2 +1.20 +23.20 -9.53
8,2,4 +0.53 +21.20 -8.19
16,4,8 +0.36 +17.80 -7.43
32,8,16 +0.18 +4.25 -1.31

层数消融显示,迭代 refine 的深度确实有收益。3 层和 5 层都比 7 层 NE 更差;9 层继续带来 -0.12% NE,但 QPS -7.16%、显存 +4.92%

层数 NE QPS Memory Diff
7 0.00 0.00 0.00
3 +0.32 +21.00 -8.60
5 +0.14 +8.80 -5.50
9 -0.12 -7.16 +4.92

上下文编码消融表明,在 reshare 任务上加入周边事件上下文约带来 -0.15% NE;主要增益来自 event-type context,加入 event content 的额外收益小于 0.02% NE。该结果指向一个推荐场景特征:行为模式本身比相邻内容语义更能解释用户偏好变化。

5.5 线上 A/B 与可解释性

论文报告,Instagram Reels 的 SlimPer 5k events 与 Feed 的 SlimPer 4k events 经过 pre-testing 和 backtesting 后全量上线,在多个主要 engagement 指标上取得统计显著提升,aggregate topline impact 约为 typical statistically significant launch 的 10 倍,并且 integrity、diversity、recency 等 ecosystem guardrail 无回退,训练与推理 GPU capacity 接近 neutral。

可解释性来自每层 QKV attention。对给定请求,SlimPer 可以产生 candidate item 到历史 sequence tokens 的 attention scores,从而定位影响推荐的 top-k 历史事件。论文对 200 个请求、5k 序列长度聚合 heatmap:低层广泛关注前 4k 位置,中层收窄到更近事件,上层继续集中到最近约 400 个事件。

优势与局限

6.1 优势

SlimPer 的主要优势来自架构假设与推荐任务目标的匹配。第一,它把中间状态固定为 K×d 知识库,避免堆叠层显存随历史长度 N 增长。第二,它没有把长历史一次性压缩成 summary,每层都能直接查询原始用户侧 token,降低早期压缩造成的不可逆信息损失。第三,显式 dot-product matching 让模型容量集中在用户-物品相关性上,而不是用户侧 token 两两混合上。第四,ROO-Aware 设计把用户侧 token 在 request 内共享,符合多候选排序的服务形态。第五,attention heatmap 能把预测关联到具体历史事件,方便线上调试与审计。

6.2 局限

论文的直接对比主要是 Instagram 成熟 baseline,也就是 HSTU 加 Wukong 的 late-fusion hybrid,而不是对 OneTrans、HHFT、RankMixer 等近期 unified transformer 架构逐一做公开同口径实验。作者解释说该 hybrid 在内部比 standalone unified HSTU 更强,且不同组织训练数据、特征集和 serving constraints 不可直接比较。

实验数据全部来自 Instagram 内部训练与评估集,外部研究者无法复现完全相同的数值。论文给出了超参数、模块定义和相对 baseline 的受控结果,足以支持工程复现方向,但不能替代公开 benchmark 上的独立验证。

SlimPer 当前 matching 与 refine 模块较轻量,主要依赖 dot-product matching 与 MLP update。论文把更表达力的 matching/refinement operator 作为后续方向,但没有在当前版本中给出更复杂算子的收益与成本曲线。

相关推荐
Sirius Wu2 小时前
OpenClaw Model Provider(模型提供商)完整详解
服务器·网络·人工智能·安全·aigc
1234Wu2 小时前
企业网站建设与SEO之后,如何补上GEO让AI搜索推荐你的品牌?
人工智能
产品推荐官2 小时前
2026年AI应用开发服务商的选择逻辑:适配度比功能清单更重要
大数据·人工智能·ai·技术分享·开发经验
虹科网络安全2 小时前
“顶会”看安全(十六):深入分析函数内联及其对基于机器学习的二进制分析的安全影响
人工智能·安全·机器学习
麻雀飞吧2 小时前
最新量化实现难点,规则和流程要先有形状
人工智能·python
武子康2 小时前
权重已到、Recipe 还在变:Kimi K3 发布后该怎样做工程验收
人工智能·后端·agent
Urbano2 小时前
打破缝制品类偏见:工序模板机跨界生产家居收纳布艺,实现服装与家居制品通用智造
人工智能·自动化
rrrjqy2 小时前
风险与组合管理——Quant-for-Beginners 量化入门Task6
大数据·人工智能
学术小白人2 小时前
医学交叉会议!EI检索!2026年人工智能与健康信息学国际学术会议(AIHI 2026)
大数据·人工智能·搜索引擎·自动化·医学