【第六章:项目实战之推荐/广告系统】3.精排算法-(2)精排算法模型精讲: DNN、deepFM、ESMM、PLE、MMOE算法精讲与实现- DNN 精排模型

第六章:项目实战之推荐/广告系统

第三部分:精排算法

第二节:精排算法模型精讲: DNN、deepFM、ESMM、PLE、MMOE算法精讲与实现

1.DNN 精排模型


一、精排为什么需要 DNN?(问题出发)

在推荐系统中,精排模型的核心目标是:

对候选集合中的每一个 item 进行精准打分,预测用户点击/转化概率,例如 CTR 或 CVR。

召回阶段更多是 粗粒度语义匹配(user embedding vs item embedding),而精排面对的是:

对象 粒度 输入特征 行为预测
召回 用户/物品 embedding 语义相关
精排 用户全量特征 + 物品全量特征 + 上下文特征 CTR/CVR 精细化预测

因此,精排模型必须具备两种能力:

  1. 非线性表达特征交互能力

  2. 适应多模态/多场景业务特征能力

=> 简单线性模型(如 LR)只能做特征加权,无法拟合用户兴趣这种复杂分布

=> DNN(多层感知机 MLP)成为精排模型最基础的骨架


二、DNN 精排模型结构图(核心形态)

复制代码
[User Sparse Feature] → Embedding ┐
                                   ├→ concat → MLP → sigmoid → CTR 预测
[Item Sparse Feature] → Embedding ┘
[Dense Feature] ───────────────────┘

特征分为三类:

特征类别 举例 处理方式
Sparse(稀疏特征) user_id、item_id、tag_id Embedding 转低维向量
Dense(数值特征) age、watch_time、ctr_stat 归一化后直接输入
Cross / Context hour、device、geo 与 user/item 拼特征

最终输入网络:

优化目标(CTR 用 BCE):


三、DNN 精排模型 PyTorch 实现(可运行)

python 复制代码
import torch
import torch.nn as nn
import torch.nn.functional as F

class DNNRankModel(nn.Module):
    def __init__(self, user_vocab, item_vocab, emb_dim=32, hidden=[128, 64, 32]):
        super(DNNRankModel, self).__init__()
        self.user_emb = nn.Embedding(user_vocab, emb_dim)
        self.item_emb = nn.Embedding(item_vocab, emb_dim)

        input_dim = emb_dim * 2 + 10  # 假设 dense feature = 10 维
        layers = []
        for h in hidden:
            layers.append(nn.Linear(input_dim, h))
            layers.append(nn.ReLU())
            input_dim = h
        self.mlp = nn.Sequential(*layers)
        self.out = nn.Linear(hidden[-1], 1)

    def forward(self, user_id, item_id, dense_feature):
        u = self.user_emb(user_id)
        i = self.item_emb(item_id)
        x = torch.cat([u, i, dense_feature], dim=-1)
        x = self.mlp(x)
        x = torch.sigmoid(self.out(x))
        return x

四、TensorFlow 版本(结构完全对齐)

python 复制代码
import tensorflow as tf
from tensorflow.keras import layers, Model

class DNNRankModelTF(Model):
    def __init__(self, user_vocab, item_vocab, emb_dim=32, hidden=[128, 64, 32]):
        super().__init__()
        self.user_emb = layers.Embedding(user_vocab, emb_dim)
        self.item_emb = layers.Embedding(item_vocab, emb_dim)
        self.mlp = tf.keras.Sequential(
            [layers.Dense(h, activation='relu') for h in hidden]
        )
        self.out = layers.Dense(1, activation='sigmoid')

    def call(self, inputs):
        user_id, item_id, dense_feature = inputs
        u = self.user_emb(user_id)
        i = self.item_emb(item_id)
        x = tf.concat([u, i, dense_feature], axis=-1)
        x = self.mlp(x)
        return self.out(x)

五、适用性分析与优缺点

维度 评价
优点 结构简单、可拟合任意特征、训练稳定,是所有精排模型基础骨架
缺点 无显式特征交互能力(与 FM/DeepFM 对比)
应用场景 早期精排、线上 baseline、工业可控场景
相关推荐
江苏赛融科技1 分钟前
数据驱动:能耗管理系统如何将能源数据转化为管理决策资产
大数据·人工智能·能源·智慧园区·企业资产管理·园区智能化
AI智图坊5 分钟前
宠物用品电商视觉内容生产的技术难点与自动化方案分析
大数据·运维·人工智能·ai作画·自动化·aigc
啥都想学点的研究生7 分钟前
一篇文章讲清楚:机器学习所用的数学知识
人工智能·机器学习
七牛云行业应用8 分钟前
国产新模型选型:GLM-5.3、DeepSeek V4、GLM-5.3-Flash、Qwen3.8-Flash-Next、Kimi K3 怎么选
人工智能·大模型·ai编程
hhzz11 分钟前
边缘AI视频分析引擎实战:可视化拖拽编排流水线把模型快速跑起来
人工智能·计算机视觉·边缘计算·智能安防·ai视频分析·流水线编排
东方佑13 分钟前
验证报告:「调度中枢」式语言模型方案的最小成本验证
人工智能·语言模型·自然语言处理
淼澄研学23 分钟前
大语言模型文本生成5大技术陷阱与LangChain RAG实操方案
人工智能·语言模型·langchain
AI杂货铺(摸鱼版)24 分钟前
企业多个AI项目怎么分API Key?按项目、工具和环境管理更稳妥
人工智能
蒲公英内测分发29 分钟前
AI 玩具 App 每周更新,怎么用 CI/CD 自动上传测试包又避免误发?
人工智能·测试工具·智能硬件·web app
彼日花30 分钟前
我做了一个开源项目,让 AI 记住我们解决过的问题:Usora
人工智能·agent·ai编程