大模型学习笔记:AI 学什么数据,决定了它能有多聪明

一句话总结

数据算法就是:给 AI 挑对输入数据,并按数据特点选对处理方法。 数据分三类------用户(主体)、物品(客体)、场景(环境),每类的玩法不一样。

打个比方:AI 像个学生,你不能什么教材都塞给它。得先分清楚哪些是"关于人的资料"、哪些是"关于商品的资料"、哪些是"关于当下环境的资料",然后因材施教。


先搞懂:数据为什么要分类?

AI 自己不会判断哪些数据重要。比如要让智能体察觉"班主任在凝视你",它得问遍全身传感器才找得到规律,但人凭经验就知道:看和听最重要,给它摄像头和麦克风就行。

所以系统里的数据统一分成三类:

类别 大白话 推荐系统里对应
主体数据 关于"人"的 用户特征
客体数据 关于"东西"的 物品特征
环境数据 关于"当下情况"的 场景特征

核心内容分三块

第一块:用户特征------搞清楚"谁在买"

用户画像是每个产品最宝贵的资源,也是 AI 系统里价值最高的数据。

DMP:用户数据的大管家

科技公司用专门的 DMP(数据管理平台) 来管用户数据,数据来源分三种:

  • 第一方数据:用户用自己产品时产生的(注册信息、点击、购买、收藏)
  • 第二方数据:公司内部其他产品或合作伙伴给的
  • 第三方数据:从数据供应商那买的

DMP 把这些综合起来生成用户画像。但有两个技术难题:

  1. 身份对齐:同一个人在多个设备、多个账号上的数据,要能认出是同一个人
  2. 挖掘潜在用户:比如找出"和保时捷车主相似的人"

这两个能力不只是提升模型效果,还是系统的"印钞机"------能大幅提高营销收入。

Lookalike:找相似的人

人群扩展算法,三大作用:

  • 挖潜在高净值用户:找到和现有优质客户相似的人,扩大推广范围
  • 提高风控能力:通过相似行为发现黑灰产团伙
  • 冷启动推荐:新用户没数据,用相似的人的特征代替

GraphSAGE:端到端的图学习

上节课讲的 DeepWalk 是"先随机游走生成序列,再丢给 Word2Vec"------分两步,会丢信息。GraphSAGE 是端到端的,一步到位,四步走:

  1. 建图:用户是节点,有相同属性就连一条边
  2. 采集:随机选一个节点,往外走两步,形成一棵树(采很多棵备用)
  3. 聚合:从最底层往上层一层层聚合信息
  4. 训练:把节点原来的特征和聚合来的邻居特征拼在一起,调参数让空间距离和真实关系一致

核心思想和大模型 Transformer 里的位置编码很像,后面会详细讲。

背后的假设叫鸭子测试:看起来像鸭子、走路像鸭子、叫起来像鸭子,那它就是鸭子。


第二块:物品特征------搞清楚"卖的是什么"

物品是商业目标的载体,和几乎所有实体都有交互,最适合建知识图谱

知识图谱(KG):一张"关系网"

属于符号主义派,用 "实体 - 关系 - 实体" 的三元组来组织知识。比如:

周杰伦 - 演唱 - 稻香 稻香 - 所属专辑 - 魔杰座

和普通图不一样的是,边上携带了丰富的关系信息。知识图谱不只是推荐系统用,也是大模型提示语工程的重要组成部分。

构建知识图谱的三步(重点记这个)

步骤 干啥的 大白话
知识抽取 从文本、网页、数据库里提取实体、属性、关系 拿知识
知识融合 解决不同来源数据的不一致和冲突,对齐实体和关系 合知识
知识加工 清洗、补全、推理,让图谱更可靠好用 学知识

具体每步用什么算法不重要(学过的算法几乎都能用),搞清楚三步的定位才重要

知识图谱能干嘛?

在推荐系统里,可以构建"物品地图",找到各个兴趣点(POI)。比如用户对"美白"感兴趣,就实时收集相关物料,自动组合成商品创意(使用前后对比图等),点击率更高。


第三块:场景特征------搞清楚"现在什么情况"

场景特征来自每次请求时客户端上报的信息,刻画用户当下的全景:

  • 在哪个界面(App、页面、广告位)
  • 设备信息(手机型号、电量、信号强度)
  • 地点信息(城市、气温)
  • ......

怎么区分场景特征和用户特征?

  • 长期习惯 → 放进用户画像(比如"这个人爱运动")
  • 高频变化 → 放进场景特征(比如"现在是凌晨3点")

实时特征:场景特征的最大价值

用户画像和物品特征相对稳定,更新慢。如果没有场景特征,模型的输入可能很长时间都不变,推荐就"僵住了"。

实时特征(比如"最近 30 分钟点击了多少商品""最近 1 小时浏览了什么")让模型变得敏感,能捕捉用户当下的意图变化。

比如用户白天在看办公椅,晚上突然在搜婴儿床------场景特征一变,推荐就得立刻跟上。


必知术语

术语 大白话
主体/客体/环境数据 关于人的 / 关于物的 / 关于当下情况的
用户画像 把用户的各种信息综合起来的"人物档案"
DMP 数据管理平台,管用户数据的大管家
第一/二/三方数据 自己产的 / 合作方给的 / 花钱买的
身份对齐 认出多个设备/账号背后是同一个人
Lookalike 找相似的人,扩人群、做风控、冷启动
GraphSAGE 端到端图神经网络,比 DeepWalk 少丢信息
鸭子测试 长得像、走得像、叫得像,就是同类
知识图谱(KG) 实体-关系-实体组成的关系网
知识抽取/融合/加工 拿知识 / 合知识 / 学知识
POI 兴趣点,知识图谱里的关键节点
实时特征 最近几分钟/几小时的行为数据,让模型变敏感

记忆口诀

数据算法三分类:

  1. 用户 ------ 画像 + DMP 管理,Lookalike 找人,GraphSAGE 算关系
  2. 物品 ------ 知识图谱装关系,抽取→融合→加工三步走
  3. 场景 ------ 抓实时变化,让模型不"僵住"

图神经网络、知识图谱、跨模态预训练,是大模型的三大前序知识,务必掌握。

相关推荐
roman_日积跬步-终至千里1 小时前
【数据工程(3)-数据架构】好的数据架构不是技术蓝图,而是管理变化的能力
大数据·架构
FreeTinker5 小时前
硬盘存储技术深度解析:从HDD到SSD,数据存储的演进与未来
架构
2601_962065255 小时前
【图文详解】什么是微服务?什么是SpringCloud?
spring cloud·微服务·架构
程序员贺加贝5 小时前
别再给主数据只做删除:从停用、归档到 ReasonCode 策略引擎
架构·saas
黄俊懿5 小时前
【架构师从入门到进阶】第五章:DNS&CDN&网关优化思路——第十节:网关安全-单向加密
网络·数据库·计算机网络·安全·架构·系统架构·架构师
怕浪猫5 小时前
用了两年 AI 编程工具后,我重新理解了什么是「资深工程师」
算法·面试·架构
2601_963749106 小时前
越华环保集团|河湖工况下数字化污水治理云边协同采集架构实现
人工智能·架构
代码方舟6 小时前
零信任架构实战:基于天远手机携号转网V即时版构建自动化营销风控网关
人工智能·智能手机·架构·自动化
会周易的程序员6 小时前
企业私有 AI 算力服务器架构设计:异构四节点 + QUIC 微服务
运维·服务器·c++·人工智能·微服务·架构