一句话总结
数据算法就是:给 AI 挑对输入数据,并按数据特点选对处理方法。 数据分三类------用户(主体)、物品(客体)、场景(环境),每类的玩法不一样。
打个比方:AI 像个学生,你不能什么教材都塞给它。得先分清楚哪些是"关于人的资料"、哪些是"关于商品的资料"、哪些是"关于当下环境的资料",然后因材施教。
先搞懂:数据为什么要分类?
AI 自己不会判断哪些数据重要。比如要让智能体察觉"班主任在凝视你",它得问遍全身传感器才找得到规律,但人凭经验就知道:看和听最重要,给它摄像头和麦克风就行。
所以系统里的数据统一分成三类:
| 类别 | 大白话 | 推荐系统里对应 |
|---|---|---|
| 主体数据 | 关于"人"的 | 用户特征 |
| 客体数据 | 关于"东西"的 | 物品特征 |
| 环境数据 | 关于"当下情况"的 | 场景特征 |
核心内容分三块
第一块:用户特征------搞清楚"谁在买"
用户画像是每个产品最宝贵的资源,也是 AI 系统里价值最高的数据。
DMP:用户数据的大管家
科技公司用专门的 DMP(数据管理平台) 来管用户数据,数据来源分三种:
- 第一方数据:用户用自己产品时产生的(注册信息、点击、购买、收藏)
- 第二方数据:公司内部其他产品或合作伙伴给的
- 第三方数据:从数据供应商那买的
DMP 把这些综合起来生成用户画像。但有两个技术难题:
- 身份对齐:同一个人在多个设备、多个账号上的数据,要能认出是同一个人
- 挖掘潜在用户:比如找出"和保时捷车主相似的人"
这两个能力不只是提升模型效果,还是系统的"印钞机"------能大幅提高营销收入。
Lookalike:找相似的人
人群扩展算法,三大作用:
- 挖潜在高净值用户:找到和现有优质客户相似的人,扩大推广范围
- 提高风控能力:通过相似行为发现黑灰产团伙
- 冷启动推荐:新用户没数据,用相似的人的特征代替
GraphSAGE:端到端的图学习
上节课讲的 DeepWalk 是"先随机游走生成序列,再丢给 Word2Vec"------分两步,会丢信息。GraphSAGE 是端到端的,一步到位,四步走:
- 建图:用户是节点,有相同属性就连一条边
- 采集:随机选一个节点,往外走两步,形成一棵树(采很多棵备用)
- 聚合:从最底层往上层一层层聚合信息
- 训练:把节点原来的特征和聚合来的邻居特征拼在一起,调参数让空间距离和真实关系一致
核心思想和大模型 Transformer 里的位置编码很像,后面会详细讲。
背后的假设叫鸭子测试:看起来像鸭子、走路像鸭子、叫起来像鸭子,那它就是鸭子。
第二块:物品特征------搞清楚"卖的是什么"
物品是商业目标的载体,和几乎所有实体都有交互,最适合建知识图谱。
知识图谱(KG):一张"关系网"
属于符号主义派,用 "实体 - 关系 - 实体" 的三元组来组织知识。比如:
周杰伦 - 演唱 - 稻香 稻香 - 所属专辑 - 魔杰座
和普通图不一样的是,边上携带了丰富的关系信息。知识图谱不只是推荐系统用,也是大模型提示语工程的重要组成部分。
构建知识图谱的三步(重点记这个)
| 步骤 | 干啥的 | 大白话 |
|---|---|---|
| 知识抽取 | 从文本、网页、数据库里提取实体、属性、关系 | 拿知识 |
| 知识融合 | 解决不同来源数据的不一致和冲突,对齐实体和关系 | 合知识 |
| 知识加工 | 清洗、补全、推理,让图谱更可靠好用 | 学知识 |
具体每步用什么算法不重要(学过的算法几乎都能用),搞清楚三步的定位才重要。
知识图谱能干嘛?
在推荐系统里,可以构建"物品地图",找到各个兴趣点(POI)。比如用户对"美白"感兴趣,就实时收集相关物料,自动组合成商品创意(使用前后对比图等),点击率更高。
第三块:场景特征------搞清楚"现在什么情况"
场景特征来自每次请求时客户端上报的信息,刻画用户当下的全景:
- 在哪个界面(App、页面、广告位)
- 设备信息(手机型号、电量、信号强度)
- 地点信息(城市、气温)
- ......
怎么区分场景特征和用户特征?
- 长期习惯 → 放进用户画像(比如"这个人爱运动")
- 高频变化 → 放进场景特征(比如"现在是凌晨3点")
实时特征:场景特征的最大价值
用户画像和物品特征相对稳定,更新慢。如果没有场景特征,模型的输入可能很长时间都不变,推荐就"僵住了"。
实时特征(比如"最近 30 分钟点击了多少商品""最近 1 小时浏览了什么")让模型变得敏感,能捕捉用户当下的意图变化。
比如用户白天在看办公椅,晚上突然在搜婴儿床------场景特征一变,推荐就得立刻跟上。
必知术语
| 术语 | 大白话 |
|---|---|
| 主体/客体/环境数据 | 关于人的 / 关于物的 / 关于当下情况的 |
| 用户画像 | 把用户的各种信息综合起来的"人物档案" |
| DMP | 数据管理平台,管用户数据的大管家 |
| 第一/二/三方数据 | 自己产的 / 合作方给的 / 花钱买的 |
| 身份对齐 | 认出多个设备/账号背后是同一个人 |
| Lookalike | 找相似的人,扩人群、做风控、冷启动 |
| GraphSAGE | 端到端图神经网络,比 DeepWalk 少丢信息 |
| 鸭子测试 | 长得像、走得像、叫得像,就是同类 |
| 知识图谱(KG) | 实体-关系-实体组成的关系网 |
| 知识抽取/融合/加工 | 拿知识 / 合知识 / 学知识 |
| POI | 兴趣点,知识图谱里的关键节点 |
| 实时特征 | 最近几分钟/几小时的行为数据,让模型变敏感 |
记忆口诀
数据算法三分类:
- 用户 ------ 画像 + DMP 管理,Lookalike 找人,GraphSAGE 算关系
- 物品 ------ 知识图谱装关系,抽取→融合→加工三步走
- 场景 ------ 抓实时变化,让模型不"僵住"
图神经网络、知识图谱、跨模态预训练,是大模型的三大前序知识,务必掌握。