字节跳动·大模型应用知识手册

字节跳动·大模型应用(商业化基模&Agent)入职 Landing 知识手册

岗位 :校园招聘 - 大模型应用(商业化基模 & Agent 方向)- 内容质量与数据服务平台

办公地点 :北京市朝阳区 时尚·万科中心 (朝阳北路 152 号院,东四环红领巾桥,5A 甲级写字楼)

业务归属 :抖音集团「内容质量与数据服务平台(CQC) 」× 字节商业化「巨量引擎 · 商业信任与安全 」------用大模型保障广告 / 生服 / 电商的商业内容安全与合规

序列 :运营序列(做算法的事、要业务的结果)

Leader 关注点懂 Agent、懂后训练、有创新能力;纯技术画像,产品向不 OK

团队形态 :模型中台,对内服务商业化三条业务线(广告投入最多)

基模方向 :商业化基座模型,对标豆包,30B / 80B 规模;旗舰落地产品为自研广告治理多模态大模型 Mamoda

Agent 方向 :智能客服、采集 Agent、研判、归因等运营提效子项目,做 auto-workflow / multi-agents / harness

当前主线「全链路治理 + 以 AI 治 AI」------规则 2.0 / Mamoda 多模态治理 / 后链路守护 / CCR 消费者抱怨指数


目录

  • [第 0 章 岗位全景:先搞清楚你在哪、要对什么负责](#第 0 章 岗位全景:先搞清楚你在哪、要对什么负责)
  • [第 1 章 业务域:商业化安全与信任(Landing 第一优先级)](#第 1 章 业务域:商业化安全与信任(Landing 第一优先级))
  • [第 2 章 基模:预训练、多模态与评测](#第 2 章 基模:预训练、多模态与评测)
  • [第 3 章 后训练:SFT 与 RL(Leader 第一关注点)](#第 3 章 后训练:SFT 与 RL(Leader 第一关注点))
  • [第 4 章 Agent 工程:Harness / 上下文 / Multi-Agent(Leader 第一关注点)](#第 4 章 Agent 工程:Harness / 上下文 / Multi-Agent(Leader 第一关注点))
  • [第 5 章 模型运营:数据飞轮与评测闭环(岗位本质)](#第 5 章 模型运营:数据飞轮与评测闭环(岗位本质))
  • [第 6 章 工程工具箱:你每天会用到的东西](#第 6 章 工程工具箱:你每天会用到的东西)
  • [第 7 章 Landing 30 / 60 / 90 天作战计划](#第 7 章 Landing 30 / 60 / 90 天作战计划)
  • [第 8 章 术语表(中英对照 + 一句话解释)](#第 8 章 术语表(中英对照 + 一句话解释))
  • [第 9 章 学习资源清单](#第 9 章 学习资源清单)
  • [第 10 章 避坑与潜规则](#第 10 章 避坑与潜规则)
  • [第 11 章 速查卡(Cheat Sheet)](#第 11 章 速查卡(Cheat Sheet))

第 0 章 岗位全景:先搞清楚你在哪、要对什么负责

他们在干什么(公开信息,2024--2026)------这是你工作的真实语境
  • 核心理念:「全链路治理 + 以 AI 治 AI」。从"管你"到"帮你"、从"单向拦截"到"主动赋能"。
  • 旗舰模型 Mamoda(重点记!) :巨量引擎商业信任与安全自研的广告治理多模态大模型
    • 迭代节奏:2024.06 首发 → 2025.10 发布 2.0 → 2026.07 发布 2.5 → 2026 下半年第五次迭代。
    • Mamoda 2.5 技术参数 :采用 DiT-MoE 架构 (MoE 混合专家 + DiT 扩散模型融合,业内首创),128 专家细粒度总参数约 25B、单次激活约 3B
    • 能力链路:风险识别 → 精准定位 → 素材自动修复(自动识别并修复素材中的常见违规点,广告主可一键调整)。
  • 官方效果口径(会出现在你的 OKR/周报里)
    • 平台 90% 的广告素材可在 10 分钟内完成审核 ,整体效率较传统模式提升约 75%
    • 2025 Q3 前置拦截 84 万+ 涉 AI 违规素材。
    • Mamoda 2.5 日均出具 1500 万条 精细化拒审诊断,每天帮助超百万条违规素材完成自动修复。
  • 规则 2.0 体系 :把模糊、非结构化的规则,重构成结构化、机器可读的「机器语言」 ,结合 SFT 与 RL 提升 AI 审核精度------这就是"懂后训练"在业务里的直接落点
  • 后链路守护 :穿透履约"黑箱",不只盯广告素材本身,还盯投放后的履约与体验
  • CCR(消费者抱怨指数):巨量引擎首创指标,整合用户评论、举报、投诉等多维负反馈,用来度量"用户到底烦不烦"。
  • 专项保障:为「一老一少」(老人与未成年人)设立专项保障通道。
  • 治理标准 :坚持"精准识别、从严处理";明确禁止广告内容出现虚构人物设定严禁冒用他人身份、姓名或职位
这些信息对你的直接含义(把工作对上号)
  1. 你的"基模"不是空谈 30B/80B ,大概率是围绕 多模态(图文/视频/音频)审核与治理基座 ,对标 Mamoda 这条线。
  2. 你的"后训练"要落到规则 2.0 → 可被模型执行的机器语言,用 SFT/RL 把审核准召顶上去。
  3. 你的"Agent"要落到机审&人审提效:研判、归因、采集、客服等。
  4. 你的产出指标要能对上业务口径:审核效率(10 分钟覆盖 90%)、前置拦截量、拒审诊断量、自动修复量、CCR。
  5. 你的差异化叙事 :把"误报率 -40%""置信度门控""数据回流"直接挂到 Mamoda 的全链路治理规则 2.0 上------这是你独有的迁移故事。

注:以上均为公开报道口径(巨量引擎商业安全开放日 2024/2025、《2025 巨量引擎商业信任与安全治理报告》、Mamoda 2.5 发布报道等),具体以入职后内部资料为准。对外沟通时注意信息边界,不要把公开报道当内部细节引用。

0.1 一句话定位

你是一个「懂业务的模型应用工程师」 :把通用大模型能力,通过后训练 + Agent 工程 ,变成商业化安全场景里对准召负责、对成本负责、可上线闭环的专属系统。

你既不是纯炼丹(训完就完),也不是纯后端(只调 API),而是模型运营:让「线上发现问题 → 归因 → 在数据/模型/流程补 → 上线 → 回流验证」这个飞轮持续转起来。

0.2 岗位的三层理解(面试/周会都用得上)

层次 说明 落地抓手
业务本质 治理诉求 vs 业务增长的平衡:漏放 = 监管/舆情风险,误伤 = 广告主收入损失 准召权衡、风险分级处置
技术栈本质 基模(多模态理解&生成)× 后训练(SFT/RL)× Agent 工程(auto-workflow/multi-agent/harness)× 工程系统 模型 + 数据 + 流程三位一体
运营闭环本质 数据飞轮转得快不快,决定模型懂不懂业务、守不守得住准召 回流速度 = 防守速度

0.3 你的产出如何被衡量(心里要有这根弦)

不要用「我训了个模型 / 跑了个实验」定义产出,而要用业务结果定义:

  • **漏放率(漏审率)**↓:违规内容没被拦出去的占比。最贵的指标,直接对应监管/舆情。
  • **误伤率(误杀率)**↓:正常素材被拦的占比。直接对应广告主收入与体验。
  • 人审介入率↓:多少比例样本要转人工。直接对应人力成本。
  • 单条审核成本 / P99 延迟↓:算力 + 人力成本。
  • 申诉通过率 / 复审推翻率:衡量判定质量与规则合理性。

一句话合格线:每个迭代都能讲清楚「改了什么、上线后哪个业务指标变了、变了多少、口径是什么」。

0.4 团队结构与协作地图

复制代码
内容质量与数据服务平台(模型中台)
├── 基模组(你所在)        商业化基座模型:语料、数据工程、评测、后训练迭代
├── Agent 组               客服/采集/研判/归因等 Agent,auto-workflow、harness
├── 业务方(产运)          广告 / 生活服务 / 电商 三条线的安全运营
├── 算法团队                共享算力,模型结构/训练支持
└── 人审团队                标注、复核、申诉处理------你的「模型老师」和「数据源」

协作原则 :业务方给你风险定义和优先级,人审给你最干净的标签,算法团队给你算力与底座支持。你要做的是把三方信号捏成一个闭环,而不是单打独斗。


第 1 章 业务域:商业化安全与信任(Landing 第一优先级)

技术你已经很强了,业务黑话和规则体系才是 landing 最大缺口。这一章是「第一周必须开口就能说」的内容。

1.1 内容安全在商业化中的角色:信任基础设施

  • 安全不是成本中心,而是信任基础设施:没有信任,广告主不敢投放、用户不敢下单、商家不敢入驻。
  • 商业化安全处在「模型能力」与「真金白银业务」的交界处------这是大模型最难证明「不只是 demo、是真价值」的战场,也是价值最容易被量化的地方。

1.2 三条业务线各自的风险侧重

业务线 典型场景 风险侧重
广告 巨量引擎投放素材(图文/视频/直播间) 黑五类、虚假营销、夸大功效、资质造假、擦边低俗
生活服务 到店/团购/本地商家 虚假门店、刷单、虚假评价、资质(餐饮/医美)、价格欺诈
电商 商品、直播带货、小店 假冒伪劣、禁限售、虚假宣传、知识产权侵权、诱导交易

广告投入最多,你大概率先接触广告机审。 生服和电商的底层逻辑(识别风险 → 分层处置 → 人工兜底 → 回流迭代)是一致的,方法论可迁移。

1.3 违规类型全景(开口就能说的「黑话库」)

具体分类以平台规则为准,以下为行业常见口径,入职后尽快对齐内部规则文档/风险百科

A. 黑五类(高危、强监管)

  • 药品、医疗器械、保健食品、医疗美容、丰胸/减肥类产品
  • 特点:涉及人身健康,无资质不得投放,夸大功效即违规;监管处罚最重。

B. 内容违规

  • 虚假宣传 / 夸大功效:绝对化用语("最"、"第一"、"根治")、虚假承诺、伪造数据。
  • 色情低俗 / 擦边:软色情、暗示性文案、低俗着装、擦边话术。
  • 违法违规:赌博、诈骗、传销、毒品、枪支、管制物品。
  • 敏感内容:政治敏感、宗教、民族、地域歧视、涉政谣言。
  • 未成年人保护:未成年人形象、诱导未成年人消费、校园相关。

C. 商业违规

  • 侵权假冒:商标、专利、著作权、盗图、冒牌。
  • 金融风险:非法集资、荐股、虚拟货币、贷款诱导。
  • 招商加盟 / 教育违规:虚假招商、违规培训广告。
  • 诱导交易:站外引流、私域导流、诱导点击。

D. 边界问题(真正的能力瓶颈)

  • 到底算不算违规?模棱两可、语义级擦边、图文结合歧义、指代与隐晦变体。
  • 边界样本才是决定模型准召天花板的地方,也是最值得你花时间的。

1.4 机审 & 人审全链路(分层漏斗)------ 必画图

复制代码
广告主/商家提交素材
        │
┌───────▼─────────────────────────────────────────────┐
│ 第 0 层:资质与准入       营业执照、行业资质、类目权限        │  ← 不满足直接拒
├──────────────────────────────────────────────────────┤
│ 第 1 层:规则 & 知识库                                     │  ← 关键词/正则/黑名单/
│   关键词、正则、黑名单账号、历史违规指纹、向量库           │     违规素材指纹/向量库
│   命中即秒杀;成本≈0,挡掉大量已知风险                     │
├──────────────────────────────────────────────────────┤
│ 第 2 层:小模型初检                                        │  ← 高并发、低延迟、GPU 最省
│   文本分类 + 图像抽帧检测 + embedding 召回                 │
│   只做两件事:高置信直接处置;拿不准往下送,绝不终判         │
├──────────────────────────────────────────────────────┤
│ 第 3 层:大模型精判                                        │  ← 处理长尾、语义级违规
│   图文结合理解、口语化擦边、指代、隐晦变体                  │
│   输出:结构化结论 + 置信度 + 依据(命中哪条规则/证据)      │
├──────────────────────────────────────────────────────┤
│ 第 4 层:人审兜底 + 处置分流                                │  ← 低置信/高客单/有争议/
│   低置信、高价值广告主、有争议、新规新类型 → 人审工单        │     新出现违规类型
│   处置:拒投 / 限流 / 修改建议 / 允许申诉                   │
└──────────────────────────────────────────────────────┘
        │
        ▼
   闭环回流:人审结果 + 广告主申诉 + 用户举报 + 事后追罚
        │
        ▼
   打标 → 清洗校准 → 进训练集 → 重训小模型 / 微调大模型 / 更新规则

核心原则(背下来,张口就说)

能不用模型就不用模型,能用小模型就不用大模型,大模型只留给长尾,最后人审兜底,再把结果回流成数据,让数据飞轮转起来。

1.5 准召权衡:把「业务代价」编码进技术决策

审核场景的核心公式不是「准确率」,而是代价矩阵

实际违规 实际合规
判定违规 ✅ TP(正确拦截) ❌ FP(误伤 → 损失广告收入)
判定合规 ❌ FN(漏放 → 监管/舆情风险) ✅ TN(正确放行)
  • 在广告安全里,FN 的代价 > FP 的代价(漏一条是监管/舆情风险;误伤顶多是损失一条广告收入)。
  • 所以冷启动策略:偏保守、高召回 ------低置信送人审、高置信自动处置;上线后用人审结果和反馈回流,逐步收紧阈值到业务能接受的误伤率。
  • 高价值广告主/关键类目要单独定阈值:它们的误伤代价更高,宁可多转人审。

置信度怎么算(不是只信模型自带概率)

  1. 模型信号 :几个类别之间摇摆、不敢下结论 → 分值打低;可以用温度缩放 / 序列概率 / 多采样一致性做校准
  2. 规则信号:字段是否齐全、内容与类别特征是否匹配、有无明显矛盾。
  3. 两路合成 → 阈值在验证集上按「误报率-召回率曲线」定,上线后随回流动态重算(防分布漂移)。

1.6 对抗是常态,不是 bug

  • 规则时代:广告主绕审靠变形字、错别字,规则一加就能堵。
  • 模型时代:违规升级为「语义级擦边」,广告主用 AIGC 批量生成隐蔽变体试探边界。
  • 所以审核是军备竞赛:谁的数据回流快、谁持续更新评测集,谁就守得住。

三件事变重要了:数据回流速度、边界样本与评测、人审定位升级(从执行者 → 模型的老师)。

对抗应对三板斧

  1. 周期性红队测试:主动生成变体测自己的模型,找漏洞。
  2. 模型优先于规则:规则易绕,模型负责语义级理解。
  3. 事后追罚闭环:被举报/追罚的变体立即回流重训。

1.7 规则与处置流程(人审日常黑话)

复制代码
素材提交 → 机审 → 命中高危/低置信 → 人审初审 → 判定
                                          ├─ 通过 → 投放 → 巡检/举报/申诉 → 复审
                                          ├─ 拒投(附理由)
                                          └─ 给修改建议 → 广告主改后重提

处罚分级:警告 / 拒投 / 限流 / 扣分 / 封禁账号 / 扣除保证金
申诉链路:广告主申诉 → 复审 → 维持原判 or 推翻(推翻样本 = 最硬的回流数据)

关键认知被申诉推翻的判定 = 最干净、最贵的训练数据(它说明模型/规则错了,且有人审背书)。这是你 30 天里要重点挖的金矿。

1.8 业务关键指标字典

指标 英文/口径 含义 你该怎么用
漏放率 FNR / Miss Rate 实际违规被判合规的比例 最贵,优先压
误伤率 FPR / False Positive 实际合规被判违规 直接影响收入
召回率 Recall 违规里被拦到多少 冷启动优先保证
精确率 Precision 拦下的里有多少真违规 上线后逐步收紧
人审介入率 HITL Rate 转人工比例 决定人力成本
申诉通过率 Appeal Pass Rate 广告主申诉成功比例 高说明误伤严重
端到端召回/误报 E2E Recall/FPR 整条链路的指标 链路 > 单点
单条成本 Cost per Item 算力+人力/条 ROI 核心
P99 延迟 P99 Latency 99 分位响应时间 实时场景红线

牢记 :单任务 99% 准确率,链路一累计就衰减。端到端评估永远大于单任务评估。

1.9 真实业务黑话(巨量引擎商业安全专属)------开口就用

以下是与本团队强相关的关键词,几乎一定会出现在你的周会、OKR、汇报和数据看板里。

黑话 含义 你该怎么接
Mamoda 团队自研的广告治理多模态大模型,2024.06 首发,2026 已到 2.5/第五次迭代 这就是你要服务的"基模",主动了解它的能力和短板
DiT-MoE Mamoda 2.5 的模型架构:MoE 混合专家 + DiT 扩散模型融合 能被问到就讲:稀疏激活(25B 总参/3B 激活)+ 扩散用于生成/修复
全链路治理 从风险识别 → 精准定位 → 素材自动修复 的端到端治理 你的 Agent 和评测都要按"链路"而非"单点"设计
以 AI 治 AI 用大模型对抗 AI 生成的违规内容(AIGC 违规) 理解 AIGC 既是治理对象、也是红队/合成数据工具
规则 2.0 把模糊规则重构成结构化、机器可读的"机器语言" 这是"懂后训练"的入口:规则 → 可执行的训练/推理信号
后链路守护 不只审素材,还穿透履约"黑箱"盯投放后的体验/履约 审核从"审素材"延伸到"审生意",指标更偏业务结果
CCR(消费者抱怨指数) 整合评论、举报、投诉等多维负反馈的首创指标 这是"准召之外"的用户侧指标,做归因时会用到
前置拦截 在素材/内容触达用户之前就拦住 对应"漏放代价 > 误伤代价",高召回策略的落点
拒审诊断 / 精细诊断 给广告主出具"为什么被拒、怎么改"的结构化说明 对应"主动赋能",是你做可解释输出和修改建议的业务场景
素材自动修复 识别并自动修复素材常见违规点,广告主一键调整 是"从拦截到赋能"的关键能力,也是 Agent 化的天然场景
专项保障通道 针对"一老一少"等特定人群的治理通道 体现治理的社会责任维度,涉及未成年人保护等规则
商业信任与安全 团队名(Trust & Safety 的商业化版本) 对外沟通用这个词,比"审核"更专业

加分表达 :面试/周会里把你说过的东西挂到这些真实名词上。例如------

"我的置信度门控 + 人工兜底 本质上就是前置拦截后链路回流 的一种实现;我理解的规则 2.0,就是把模糊规则变成模型能学的结构化信号,这正好是我做过后训练数据工程的地方。"

1.10 真实操作场景:你每天会碰的系统、流程与"脏活"

前面是"知道",这一节是"怎么干"。这是从「懂概念」到「能上手」的桥。

① 你每天的工作循环(口语版)

复制代码
早上先看昨天数据(漏放 / 误伤 / 拒审量 / 人审介入率 / CCR)
  → 挑出 bad case 和「申诉被推翻」的样本
  → 归因:到底是数据、模型、规则还是流程的问题?
  → 决定动作:补数据 / 改规则或 prompt / 调阈值 / 提一次训练
  → 离线评测 + 小流量灰度
  → 看业务指标有没有真的变好
  → 回流进训练集、更新评测集、写周报
  → 第二天重复

② 你会频繁接触的平台与名词(公开产品名)

名称 是什么 你会怎么用
巨量广告(投放平台) 广告主投放素材、看审核结果 理解素材从哪来、拒审结果怎么呈现给广告主
巨量千川 电商 / 直播带货投放 电商侧的违规与治理
巨量星图 达人商单撮合(品牌 × 达人) 内容合作场景的合规
审核结果 / 拒审原因 平台给广告主的反馈 你的诊断输出最终会出现在这里
申诉链路 广告主申诉 → 复审 被推翻的样本 = 最硬的回流数据
规则库 / 规则 2.0 结构化、机器可读的审核规则 你训练/推理时规则的来源
数据看板 指标监控 你要能看懂、并能自己拉数

③ 真实工作里的"脏活"清单(别嫌弃,这是信任的起点)

  • 拉数、清洗标注、对齐标签、跑报表、盯回流队列、复核评测集、人工抽检。
  • 人审 / 标注体系三个必懂概念:
    • 标注规范:什么算违规、边界怎么判(这是规则落地的最后一公里)。
    • 质检 QA:抽检纠错,发现标注错误 → 回流修正。
    • 标注一致性:多人标注一致率(如 Cohen's Kappa),一致率低说明规则本身模糊,得先修规则。

④ 入职后必须确认的"操作层"信息(外部查不到,问 mentor)

  • 数据在哪:数仓入口、常用表名与字段、权限怎么申请。
  • 评测在哪:专测集路径、回归怎么跑、有没有 CI 化。
  • 模型在哪:Mamoda 的调用/微调方式、能力边界、延迟与成本。
  • 资源在哪:推理/训练算力入口、实验管理平台、排队情况。
  • 流量在哪:灰度 / 影子 / AB 平台怎么用。
  • 指标在哪:看板位置、每个指标的口径定义。

第 2 章 基模:预训练、多模态与评测

2.1 预训练 vs 后训练:一句话分工

预训练给模型「知识」,后训练给模型「行为和性格」。

预训练 = 从海量语料学「文字接龙」和世界知识;后训练 = 把知识格式化成指令跟随、安全对齐、任务能力。

为什么后训练是这个岗位的主战场(三个经济学事实)

  1. 杠杆率最高:同样 GPU 小时,投在后训练上的能力回报远高于继续预训练。
  2. 差异化最强:基座趋同,各家平台的「审核风格」「安全底线」几乎全来自后训练配方。
  3. 离钱最近:商业化要的不是通用基座,是「懂业务、守规矩、对准召负责」的专属引擎------这正是后训练的产出。

2.2 商业化基座:30B / 80B 对标豆包,旗舰落地是 Mamoda

⚠️ 一个必须入职后问清楚的点 :面试情报里的「商业化基座模型 30B / 80B 对标豆包」与公开信息里的「Mamoda 2.5(约 25B)」未必是同一条线 ------前者可能是通用商业化基座,后者是广告治理专用模型;也可能 Mamoda 是基座之上的一层。别对外混着说 ,入职第一周务必向 mentor 确认:基座模型与 Mamoda 是什么关系?我到底服务哪一个?

  • 现状:通用场景用豆包,但商业化安全场景表现不佳(通用模型不懂审核规矩)。
  • 目标:用商业化语料训练/后训练自己的基座,规模 30B / 80B,配合后训练专精安全信任。
  • 旗舰落地(记牢)Mamoda ------团队自研的广告治理多模态大模型
    • 2024.06 首发 → 2025.10 2.0 → 2026.07 2.5 → 2026 下半年第五次迭代。
    • Mamoda 2.5 = DiT-MoE 架构 :MoE(混合专家)+ DiT(扩散)融合;128 专家细粒度、总参 ~25B、单次激活 ~3B
    • 能力:风险识别 → 精准定位 → 素材自动修复;90% 素材 10 分钟内审完,效率 +75%;日均 1500 万条拒审诊断。
    • 对你的意义:你未来做的"基模优化/评测/后训练",很可能就是给 Mamoda 这条线补能力、提准召、降成本。入职第一周就去把它当前的能力边界问清楚。
  • 差距量化 :用同一套商业化专测集 ,通用模型和自研模型各跑一遍,按类别拆开对比准召/误报率,落到同一评测口径------差距量化不能靠感觉

2.3 多模态理解 & 生成基座(本岗位技术关键词)

方向 关键任务 审核场景落点
多模态理解 图文/视频/音频联合理解、OCR、目标检测、跨模态对齐 图文结合违规、视频抽帧、直播实时
生成基座 图像/视频/文本生成、AIGC 检测 识别 AIGC 违规、生成对抗样本、合成边界样本

大模型 vs 传统模型(YOLO/BERT)怎么选

维度 传统模型 大模型/VLM
泛化性 换域要重训 长尾/新场景免重训
少样本 需大量标注 Few-shot 可顶
多模态 原生支持
成本/延迟 高(需分层/缓存/量化压)

选型原则(ROI 最优):数据少 → LoRA + 小模型起步;能用规则 → 不上模型;实时场景 → 小模型初检 + 大模型精判;开放长尾 → 上大模型(MoE 推理成本可接受)。

2.4 模型结构速通(能画能讲即可)

  • Transformer :Self-Attention,n 个 token 有 n² 对关系 → 上下文越长注意力越被摊薄(Context Rot 的架构根因)。
  • MoE(混合专家):稀疏激活,总参数大、激活参数小 → 推理成本可控。是 30B/80B 基座的常见结构。
  • 位置编码 / 长度外推:RoPE、位置插值,决定长上下文能力(有精度衰减)。
  • KV Cache:推理加速核心,前缀缓存(Prefix Caching)直接省钱。
  • 量化:PTQ(AWQ/GPTQ)、QAT;W4A16 等,审核场景常用。
  • 并行:TP(张量并行)、PP(流水线并行)、DP(数据并行)、EP(专家并行,MoE 用)。

2.5 评测体系:三层设计(入职必用)

复制代码
第一层:通用能力评测    公开 benchmark(理解/推理/多模态)        → 底线,别掉队
第二层:业务专测集      商业化安全专测集(你的主战场)              → 准召、边界、对抗
    · 从线上真实样本采样 + 人工标注
    · 覆盖违规类别全景:正/负/边界样本
    · 边界样本才是真正瓶颈
第三层:链路级评测      端到端召回率、端到端误报率、人审介入率、单条成本、P99

评测集防泄漏三板斧

  1. 时间切分隔离:训练用旧样本,评测用新样本。
  2. 对抗生成样本:防模型死记。
  3. 定期更新 + 人审抽检:对抗是动态的,静态评测集测不出真实表现。

迭代闭环 :线上 bad case 回流 → 归因(数据/模型/阈值/流程)→ 分类补强 → 同一套 benchmark 全量回归(防止某类好了另一类崩)。


第 3 章 后训练:SFT 与 RL(Leader 第一关注点)

3.1 后训练全景图

复制代码
         稠密信号
            ▲
    SFT     │     在线策略蒸馏 (OPD)
 (离线模仿) │   (在线模仿,2025-2026 新贵)
            │
  离线 ◄────┼────────────────────► 在线
            │
   DPO/KTO  │   RLHF / RLVR / GRPO / PPO
 (离线偏好) │   (在线试错,信号稀疏)
            │
         稀疏信号

记忆口诀:SFT 建基线 → DPO 调安全偏好 → GRPO/RLVR 做可验证任务 → PPO+RM 留给高精度关键路径。

3.2 SFT(监督微调):三个关键认知

  1. SFT 是「激活和格式化」预训练已有能力,不是注入新知识。 跳过 SFT 直接 RLHF 效果很差(InstructGPT 核心发现)。
  2. 少量高质:LIMA 证明 ~1000 条精选数据可接近 SOTA。审核场景 = 精选「什么是违规/合规」的典型 case,把审核行为模式格式化出来。
  3. SFT 决定 RL 的起跑线:RL 只能雕刻策略分布内已有的行为,不能凭空创造。

审核 SFT 的产出格式示例(结构化、可解释):

json 复制代码
{
  "input": "<素材描述/图像+文本>",
  "output": {
    "label": "违规",
    "category": "医疗保健-夸大功效",
    "confidence": 0.86,
    "evidence": ["文案含'根治'绝对化用语", "未提供医疗器械资质"],
    "suggestion": "建议修改『根治』为『辅助改善』"
  }
}

3.3 RL 算法家族(选型表 ------ 必背)

算法 核心机制 代价 适用场景 代表
SFT 离线模仿 一切任务的起点 ---
DPO 直接用偏好对优化,无奖励模型 便宜、稳 安全/偏好约束("这类就是不能放") 各类对齐
KTO 只需好/坏单标签,不需成对 便宜 偏好数据难配对的场景 ---
GRPO 去 Critic,组内相对优势 省显存 可验证奖励任务(规则/类目/代码) DeepSeek-Math/R1
GSPO GRPO 改进,序列级重要性采样 训练更稳 替代 GRPO,对 MoE 友好 Qwen(2025)
PPO Critic + 独立奖励模型 贵、精度高 奖励可精细建模的高价值路径 各家用

选型本质两点:奖励信号可不可验证、预算允不允许上 Critic。

GRPO 的「组内相对优势」:对同一问题采一组答案(group),用组内 reward 均值作基线,优势 = 自身 reward − 组均值。去掉 Critic → 省显存、少一个模型;代价是 reward 稀疏时波动大。

各家的取舍(体现深度)

  • DeepSeek-V3.2 没放弃 GRPO,而是 Scaling GRPO:无偏 KL、off-policy 掩码、路由一致性等工程改进。
  • Qwen 用 GSPO 修 GRPO 的「序列级奖励 vs token 级重要性采样不对齐」导致的不稳定。
  • Kimi 走分任务 RL + 模型合并,减少任务冲突。

3.4 审核场景的奖励函数设计(直接可用的模板)

审核的分寸在于:拦对和放对都是奖励,不能只奖励拦截。

python 复制代码
def reward(sample, pred, label, task_type):
    # 主判奖励:用代价权重编码业务偏好(漏放代价 > 误伤代价)
    if pred.label == label.label:
        r_main = +1.0
    elif label.label == "违规" and pred.label == "合规":      # 漏放
        r_main = -2.0
    elif label.label == "合规" and pred.label == "违规":      # 误伤
        r_main = -1.0

    # 置信度校准奖励:鼓励"拿不准就说不确定"→ 与人审兜底衔接
    r_calib = +0.2 if (pred.confidence < 0.5 and pred.says_unsure) else 0.0

    # 格式与可解释奖励:必须有结构化字段 + 依据,便于人审复核与申诉追溯
    r_fmt = +0.2 if (pred.structured and pred.evidence) else -0.2

    return r_main + r_calib + r_fmt

设计要点与坑

  • 防 reward hacking:模型可能为拿格式分乱报格式而不真正判对 → 格式分权重不能过高,且要抽检。
  • reward 缩放要稳 ;GRPO 组内基线在稀疏 reward 下会抖 → 先 SFT 建基线再上 RL
  • 奖励来源优先级:人审结果 > 规则判据 > 端到端指标(漏放率/误伤率)合成。
  • 审核最幸福的地方:对错有人审标签和规则兜底,是天然稠密、可验证的奖励信号 → 最适合可验证 RL。

3.5 后训练数据工程(护城河)

认知 :2025 年以来各家技术报告里,后训练数据管线的篇幅都远超算法本身。数据工程是真正的护城河,配方 > 算法。

三步走

复制代码
① 数据分层
   安全红线数据:高质少量,人审确认违规 + 规则标注 + 专家构造 → 用于 SFT 建底线
   业务偏好数据:海量 noisy,线上全量采样 → 用于 RL/DPO 对齐"该放/该拦"

② 清洗提质
   去重 / 去污染(防评测集泄漏)/ 格式规范 / 标签校准(修人审错标)
   难例挖掘(模型判错 + 人审纠正 = 最有价值)
   类别均衡 / 长尾过采样或合成扩充
   合成数据(强模型生成边界 case、变体、对抗样本)

③ SFT → RL 分步
   先 SFT 高质量小样本建基线 → 再 DPO/GRPO/PPO 调偏好

标签可信度排序人审确认 > 规则标注 > 模型自标 > 合成

正负样本极不平衡(合规 >95%)处理

  1. 采样策略:违规全留,正常按比例采,重配比。
  2. 类别均衡:长尾违规过采样/合成。
  3. 难例优先:人审介入率高的单独成集、提权重。
  4. 业务加权:高价值广告主/类目的样本更高权重(把业务代价编码进数据配比)。

合成数据的边界

  • ✅ 能用:扩边界样本、生成对抗样本(红队/评测集)。
  • ❌ 不能用:不能拿合成数据做「准召真相」(无真人确认)。
  • ⚠️ 防 Model Collapse:合成只做「扩边界」不做「立基准」,控占比、定期用真实数据对冲。

规则时效性 :给数据打规则版本号 + 生效时间窗。规则新增 → 补新样本;规则修改 → 旧样本复核降权;规则删除 → 标记/清除失效正例。

审核模型的迭代速度,本质是「规则变更 → 数据回流」的速度。

回流策略(不是全部回流)

  • 高价值必回流:人审推翻模型的样本、申诉被支持的样本(误伤证据)。
  • 中价值采样回流:人审与模型一致的常规样本。
  • 低价值过滤:重复、无争议简单样本。
  • 节奏控制:与模型迭代周期对齐,用最近一段时间的回流数据,保持新鲜度。

3.6 Agentic RL(2025-2026 热点)

  • 定义:把 RL 扩展到工具使用 / 长任务执行,奖励 = 过程奖励 + 结果奖励。
  • 审核场景的可落地路径:先在可验证子任务上做(规则命中、类目判定、格式合规),奖励客观、可自动判定。
  • 当前长程任务成功率仍不高(空间大);前沿突破口:过程奖励隐式化、自我博弈式环境生成、带置信度校准的模型裁判。

3.7 训练工程(够用即可)

  • 微调范式:全参 SFT / LoRA / QLoRA(4-bit NF4 + LoRA,省显存)。
  • LoRA 原理:冻结原权重,注入低秩增量 ΔW = B·A,只训 B/A;即插即拔,多任务挂不同 adapter。
  • 框架:HF Transformers + PEFT + TRL(SFT/DPO/GRPO 都有实现)、DeepSpeed/Megatron(大规模)、vLLM(推理/rollout)。
  • 显存:梯度检查点、ZeRO 分片、FlashAttention、混合精度。
  • :数据泄漏(训练/评测不隔离)、标签错标、reward 尺度、KL 系数、学习率过大导致 SFT 灾难性遗忘。

第 4 章 Agent 工程:Harness / 上下文 / Multi-Agent(Leader 第一关注点)

4.1 Agent 的准确定义

Agent = LLM 在循环中自主使用工具 (Anthropic 简化定义)。

核心循环:LLM 输出下一步 → 执行工具 → 结果追加进上下文 → 重复,直到判定 done

python 复制代码
context = [initial_event]
while True:
    step = llm.determine_next_step(context)   # 工具调用 or 终止
    context.append(step)
    if step.intent == "done":
        return step.answer
    context.append(execute(step))             # 环境反馈(ground truth)
  • Workflow = LLM 和工具经预定义代码路径编排(确定性强)。
  • Agent = LLM 动态决定自己的流程和工具使用(灵活性高)。

4.2 何时用 Agent?(不要过度设计)

先找最简单的解法,只在证据表明更复杂能提升结果时才加复杂度。

场景 推荐
单次 LLM 调用 + 检索 + few-shot 就够 别上 Agent
任务可清晰分解成固定子步骤 Prompt Chaining / Workflow
输入有明显类别、可分类 Routing
子任务可并行 Parallelization
子任务数量不可预测、需动态分解 Orchestrator-Workers
有明确评估标准、可迭代改进 Evaluator-Optimizer
开放式、步骤数不可预测、路径无法硬编码 Agent

审核场景落点 :确定性流程(资质校验、规则命中、格式检查)用 Workflow ;长尾语义判断用 Agent ;整体是「确定性外壳 + Agent 内核」。

4.3 Anthropic 六大组合模式(画图能讲)

  1. Prompt Chaining(提示链):分解为固定步骤,中间可加程序化检查(gate)。用延迟换准确率。
  2. Routing(路由):分类输入 → 分发到专用子任务/prompt/模型。简单请求走小模型。
  3. Parallelization(并行):Sectioning(拆独立子任务并行)/ Voting(多次采样投票)。
  4. Orchestrator-Workers(编排者-工作者):中央 LLM 动态拆解、委派、汇总。子任务不预先定义。
  5. Evaluator-Optimizer(评估者-优化者):一个 LLM 生成,另一个评估反馈,循环迭代。
  6. Agents(自主智能体):环境反馈循环,可在检查点暂停等人工,设有停止条件(最大轮数)。

三大原则保持简单、过程透明、精心设计 ACI(Agent-Computer Interface,即工具)。

4.4 Harness 解剖(JD 关键词,必懂)

Harness = Agent 的运行外壳:把「一个裸模型」变成「能稳定干活的 Agent」的所有工程封装。

复制代码
Harness
├── 系统提示词       身份、目标、约束、输出格式、few-shot
├── 工具协议         Tool 定义/Schema/注册/参数注入/返回规范(MCP/Function Calling)
├── 上下文管理       组装、裁剪、压缩(compaction)、记忆(notes)、跨会话 Memory
├── 循环控制         步数上限、终止判定、重试、超时、错误恢复、预算控制
├── 状态与持久化     可恢复、可审计、可回放(checkpoint)
├── 安全护栏         权限、HITL、内容过滤、工具沙箱
└── 可观测性         轨迹追踪、Token/成本、延迟、行为审计

好 Harness 的标准:简单、透明、可观测、可恢复、便宜。

4.5 Tool Calling / MCP / Tool Schema 设计

Tool 三件套(解耦 Runtime 与业务)

  • Tool Registry:启动扫描登记元数据(id/schema/endpoint),支持动态注册。
  • Schema Management:JSON Schema 定义、版本、参数校验。
  • Parameter Injection:按 Schema 自动填参,统一返回结构。
json 复制代码
{
  "name": "check_ad_qualification",
  "description": "校验广告主行业资质,返回是否具备投放权限。适用于医疗/金融等强资质类目。",
  "parameters": {
    "type": "object",
    "properties": {
      "advertiser_id": {"type": "string", "description": "广告主 ID"},
      "category":      {"type": "string", "enum": ["medical","finance","education","other"]}
    },
    "required": ["advertiser_id", "category"]
  }
}

工具设计最佳实践(Anthropic):

  • 把工具当给初级工程师写的 docstring:示例、边界、格式要求、与其他工具的区别。
  • 参数名要有描述性、无歧义;Poka-yoke(让错误用法难以发生,如强制绝对路径)。
  • 不要工具膨胀:功能重叠、定义模糊会让模型选错。人类工程师说不清该用哪个,模型更不行。
  • 返回结果要 token 高效
  • MCP(Model Context Protocol) :工具/上下文标准化接入协议,动态发现与调用。A2A:Agent 间通信与任务分派协议。

4.6 Context Engineering(2025 核心概念,必懂)

上下文工程 = 在 LLM 有限的注意力预算里,持续筛选「最小高信号 token 集合」。

三个底层事实

  1. Context Rot:token 越多,模型准确召回能力越低(注意力被摊薄,n² 关系)。
  2. 注意力预算有限:每个 token 都在消耗预算(marginal returns 递减)。
  3. 上下文是有限资源:要当成稀缺资源管理。

上手指南

  • System Prompt :说清楚,但别硬编码脆弱逻辑(right altitude);分区组织(<背景><指令># 工具指引# 输出格式)。
  • Tools:最小可用集合,自包含、抗错、清晰。
  • Examples:多样化、典型,不要堆边界 case 长清单。
  • 消息历史:informative yet tight。

长任务三技法

技法 做什么 适用
Compaction(压缩) 接近窗口上限时摘要历史,用摘要重启新窗口;保留架构决策/未解 bug/关键细节,丢弃冗余工具输出 需要大量来回的任务
Structured Note-taking(结构化笔记/Agentic Memory) Agent 定期把进展写到窗口外的记忆文件(NOTES.md / to-do) 有清晰里程碑的迭代开发
Sub-agent(子智能体) 子 Agent 用干净窗口深挖,只回传浓缩摘要(1-2k token),主 Agent 负责协调 可并行探索的复杂研究

Just-in-time 检索 :不预先塞所有数据,而是让 Agent 用轻量标识符(文件路径、查询、链接)运行时按需加载(Claude Code 的 glob/grep 思路)。混合策略:一部分预取(如 CLAUDE.md 直接入上下文),一部分按需探索。

上下文压缩五层(实操清单)

  1. 截断超出预算的后半部分。
  2. 删除单个冗余/循环的工具调用结果。
  3. 合并连续的同类工具调用。
  4. 生成会话摘要 → 替换原始历史。
  5. 全量摘要 + 写入 JSONL 存储(跨会话)。

4.7 Multi-Agent(领导关注,别踩坑)

单 Agent + 多 Tool vs Multi-Agent

  • 单 Agent:任务内聚、状态共享简单 → 用它。
  • Multi-Agent(Supervisor/Router):子任务边界清晰、需独立上下文/记忆/权限、不同能力用不同模型/提示词 → 才拆。

什么时候拆(收益 > 成本)

  • 上下文污染严重(工具描述互相干扰)
  • 权限/数据敏感度需要隔离
  • 需要独立的长上下文/RAG 或不同模型

Multi-Agent 的坑(必背)

  1. 上下文污染:工具一股脑塞给一个 Agent → 描述干扰、上下文膨胀。→ 按角色分散注册工具。
  2. 成本爆炸:每个 Agent 是完整循环,token 是单 Agent 的 3-10 倍。
  3. 调试困难:错误跨 Agent 传播,定位难。→ Agent 级可观测性(Agent Tree)。
  4. 任务冲突:子 Agent 对同一事实给矛盾结论。→ 结果聚合层统一 Schema、冲突处理。

原则:能用单 Agent 就不上多 Agent。拆之前先算账。

4.8 Auto-workflow:确定性外壳 + Agent 内核

  • Workflow 式(Dify/n8n/扣子):节点固定、输入输出可校验,适合流程稳定、要审计、低成本、可控的业务。缺点:覆盖不了长尾变体。
  • Agent 式:自由规划 + 工具调用,适合长尾、多变、难枚举。缺点:不确定、贵、难调、有幻觉风险。
  • 主流趋势:外壳用 workflow/规则/校验兜底,内核用 LLM 决策处理长尾。
  • DAG 编排 vs 线性 Pipeline :DAG 支持并行、条件分支、节点复用(Sub-Workflow/Nested Workflow);难点是拓扑排序、循环依赖检测、节点级错误隔离与状态回传。
    • 线性 Pipeline 是 DAG 的简化版;Agent 循环是有环图,比 DAG 更进一层。

4.9 HITL(Human-in-the-Loop)

  • 低置信 / 高风险 / 有争议样本转人工。
  • 实现方式:Agent 在检查点暂停(launch/pause/resume API),把状态持久化,人工审批后继续。
  • 审核场景 HITL 就是「人审兜底」:人审结果回流成最干净的训练/奖励信号------人审是模型的老师。

4.10 Agent 可观测性与评估(评估前提)

可观测性看什么

  • 会话级 Agent Tree:每轮思考、工具调用、文件变更、行为审计。
  • Context Health:Token 消费曲线(非线性增长?)、上下文占用率、压缩事件频率、响应延迟与操作密集度。
  • 退化判断:连续多轮 Token 斜率异常 / 接近窗口上限 / 压缩频发 → 主动预警。(阈值用历史基线 + 滑动窗口自适应)

Agent 评估四层指标

层级 指标
任务级 任务完成率、端到端成功率、Pass@k
模块级 意图识别准确率、工具调用成功率(选对/参数对)、RAG 检索命中率
成本级 Token 消耗、回合数、P99 延迟、单次成本
质量/业务级 误报率/漏报率、人工介入率、用户满意度

评估方法三层:规则判断(能跑测试就跑,如 coding agent 跑单测)→ LLM-as-Judge(轨迹+预期打分)→ 线上真实反馈回流。

4.11 12-Factor Agents 速记(生产级 Agent 原则)

  1. 自然语言 → 工具调用。
  2. Own your prompts(自己掌控提示词,别被框架黑盒化)。
  3. Own your context window(自己掌控上下文窗口)。
  4. Tools 就是结构化输出。
  5. 统一执行状态与业务状态
  6. 用简单 API 做 launch/pause/resume。
  7. 用工具调用联系人类(HITL)。
  8. Own your control flow(自己掌控控制流)。
  9. 把错误压缩进上下文窗口
  10. 小而专注的 Agent
  11. 从任何地方触发,到用户所在之处。
  12. 把 Agent 做成无状态 reducer

4.12 Agent 成本优化三层

  1. 上下文层:丢弃早期轮次、工具结果摘要化、滚动/分层摘要、系统约束外置到持久规则文件、上下文外置到向量库按需注入。
  2. Token 层:KV Cache / 前缀缓存复用、精简工具描述与 Schema、few-shot 精简、系统提示词瘦身。
  3. 架构层:意图路由(简单请求小模型挡掉)、任务拆解避免重复上下文、按需注册工具(别全塞)。

第 5 章 模型运营:数据飞轮与评测闭环(岗位本质)

5.1 模型运营飞轮(背下来)

复制代码
线上发现问题(bad case/申诉/举报)
        ↓
      归因(数据 / 模型 / 阈值 / 流程)
        ↓
  在对应环节补(补数据 / 改模型 / 调阈值 / 改流程)
        ↓
      离线评测 + 小流量灰度上线
        ↓
      业务指标验证
        ↓
      回流成新数据 ──────────┐
        ↑                    │
        └────────────────────┘

谁能把这个闭环转得快,谁的模型就最新、最懂业务、最守得住准召。

5.2 迭代验证三件套(缺一不可)

  1. 离线评测:同一套专测集,新旧模型对比准召/误报率(防明显回退)。
  2. 线上回归影子模式 / 小流量灰度------先跑影子对比行为分布,再灰度 5%-10%。
  3. 业务指标 :漏放率、误伤率、人审介入率、申诉通过率,按类别拆开看

⚠️ 离线指标提升 ≠ 线上提升 (评测集与线上分布有偏差)。最终标准是业务指标。

5.3 排障方法论:指标定位 → 分层归因 → 针对性修

  • 先看端到端指标:问题是「完成不了」还是「完成得贵」?
  • 逐层归因
    • Agent 场景:意图解析层 → 工具调用层 → RAG/知识层 → 上下文/记忆层。
    • 审核链路:规则层 → 小模型层 → 大模型层 → 人审流程层。
  • 针对性修每次只改一处,跑同一套回归,用结果验证而不是拍脑袋。

最大坑 :一上来就调 prompt / 换模型。瓶颈往往在数据或流程。先归因、再动手。

5.4 事故处理:先止血 → 再追因 → 再防复发

  1. 止血:加临时规则/阈值挡住,评估同类样本全部捞回复核,控制影响面。
  2. 追因:数据 / 模型 / 阈值 / 流程,分别对应补数据、换策略、调阈值、改流程。
  3. 防复发:样本回流进训练集、评测集补这类 case、建立回归监控。

5.5 优先级决策:数据找瓶颈 → 业务代价排序 → ROI 决定做多深

  1. 拉出全链路指标,看哪个环节失分最大。
  2. 按业务代价排序:先堵大窟窿(漏放 > 误伤),高价值客户优先。
  3. 算 ROI:优先「改动小、见效快、能验证」的(数据侧、评测侧通常先做)。
  4. 用数据验证,每次只改一处。

5.6 一个真实 bad case 的归因 walkthrough(照着练)

场景:周一早上发现「医美类广告误伤率比上周涨了 3 个百分点」,同时广告主申诉量上升。

第 1 步:先定量,别慌着改

  • 拉上周 vs 上上周:按二级类目拆误伤率,确认是全类目普涨 还是只有医美涨
  • 结论示例:只有"医美-皮肤管理"子类涨,其他类目平稳 → 问题局部化。

第 2 步:看形态,定位在哪一层

  • 抽 50 条误伤样本,人工快速过一遍,分三类:
    • 规则层误杀(关键词/正则太严)
    • 模型误判(语义理解错、边界判错)
    • 流程问题(该走人审的没走、阈值漂移)
  • 结论示例:60% 是模型把"护肤"相关正常文案误判成"医疗功效"。

第 3 步:归因到具体原因

  • 发现上周规则 2.0 更新了「医疗功效」定义,新增了"修复、治疗"等词 → 模型被新规则带偏,把生活美容也扫进去了。
  • 这是典型的规则变更 → 数据/模型未同步问题。

第 4 步:最小动作 + 验证(每次只改一处)

  • 方案 A(快):在规则层加"生活美容"白名单/排除词,人审兜底。
  • 方案 B(稳):补一批"生活美容 vs 医疗美容"的边界样本进 SFT,重跑专测集。
  • 先做 A 止血(当天灰度验证),再做 B 根治(一周一个迭代)。

第 5 步:防复发

  • 把这类 case 加进评测集(防止下次同类回归)。
  • 建立"规则变更 → 影响面评估"的检查项:规则改了什么、会影响哪些类目、要不要同步补数据。

这个 walkthrough 的价值 :它演示了本岗位最核心的思维方式------先归因、再动手;按规则/模型/流程分层;每次只改一处;用业务指标验证;把教训沉淀进评测集。把这套讲清楚,比堆任何算法名词都值钱。


第 6 章 工程工具箱:你每天会用到的东西

6.1 SQL(硬功底,别掉链子)

  • 高频:分组聚合、窗口函数(ROW_NUMBER/RANK/LAG/LEAD)、JOINCASE WHEN、CTE(WITH)。
  • 审核场景典型:按类别统计漏放/误伤、按天看误报率趋势、TopK 违规类型、滑动窗口计数(限流分析)。
  • 性能:建索引、避免函数索引失效、大表用 EXPLAINtype/key/Extra
sql 复制代码
-- 按违规类别统计 precision / recall
WITH stat AS (
  SELECT category,
         SUM(CASE WHEN pred='违规' AND label='违规' THEN 1 ELSE 0 END) AS tp,
         SUM(CASE WHEN pred='违规' AND label='合规' THEN 1 ELSE 0 END) AS fp,
         SUM(CASE WHEN pred='合规' AND label='违规' THEN 1 ELSE 0 END) AS fn
  FROM audit_samples GROUP BY category
)
SELECT category,
       tp*1.0/NULLIF(tp+fp,0) AS precision,
       tp*1.0/NULLIF(tp+fn,0) AS recall
FROM stat;

6.2 Python(工程熟练度)

  • pandas / polars 处理标注数据;jsonlines 流式读大文件(生成器省内存)。
  • asyncio / aiohttp 并发调用 LLM API;concurrent.futures 做并发控制。
  • 重试与超时:tenacity 或自写 retry 装饰器;注意幂等
  • 上下文快照要用深拷贝copy.deepcopy),否则回放错乱。

6.3 数据处理与存储

  • 大规模数据:Spark / Hive(数仓); 小规模 pandas。
  • 日志/流水查询:ES 适合全文检索,MySQL 适合结构化。
  • 分表/索引:一天几百万条审核结果 → 按时间分区、归档冷数据。

6.4 检索与向量

  • Embedding + 向量库(Faiss/Milvus/PGVector)。
  • Hybrid Search:稠密向量 + 稀疏关键词(BM25),兼顾语义与精确匹配(设备编号、规则条款)。
  • Rerank:交叉编码器在粗排结果上精排。

6.5 推理与部署

  • vLLM / TensorRT-LLM / SGLang:高吞吐推理、PagedAttention、前缀缓存。
  • 量化:AWQ/GPTQ/FP8。
  • ONNX:跨框架转换;边缘部署(如 Hailo)需处理算子兼容(你已有经验)。
  • 缓存:相同/相似素材直接命中缓存。

6.6 训练与实验

  • Transformers + PEFT + TRL (SFT/DPO/GRPO);DeepSpeed / Megatron 大规模。
  • 实验管理:清晰记录 config、数据版本、指标;可复现是底线。
  • 评测脚本:把 benchmark 跑成自动回归(CI 化)。

第 7 章 Landing 30 / 60 / 90 天作战计划

Week 1(入职首周):搞清楚地图

  • 拿到并通读:团队 OKR、业务规则文档、风险百科、现有评测集说明、数据管线文档。
  • 重点搞懂两件事Mamoda 当前版本/能力边界/短板,规则 2.0 是怎么被模型消费的(这是你后续所有工作的底座)。
  • 认识关键人:mentor、基模组同学、Agent 组同学、业务方对接人、人审团队负责人。
  • 摸清现状:现在线上模型是什么、指标基线是多少(前置拦截量/拒审诊断量/CCR 等)、数据从哪来、评测怎么做、卡点在哪。
  • 建立术语对齐:把本手册第 1、8 章过一遍,听不懂的黑话当场问。
  • 环境准备:代码仓库、数据权限、算力入口、内部平台(实验/评测/监控)。

第 1 个月:摸清楚 + 拿一个小结果

  • 主线 :把线上 bad case 和模型误判拉出来做一轮归因分析------瓶颈在数据、模型还是流程?
  • 交付物:一份归因报告(问题分布 + 根因 + 建议优先级)。
  • 小改进 :挑一个最有把握的环节做小改动(大概率在数据侧 :标签校准/难例回流,或评测侧:补边界样本)。周期短、风险低,能立刻检验你的判断。
  • 验收:改动前后同一套回归,业务指标变化可讲清口径。

第 2 个月:跑通一个闭环

  • 把一个环节做成可复用的闭环:归因模板 + 回流策略 + 回归看板。
  • 参与/主导一次后训练迭代(数据配方 → SFT/RL → 评测 → 灰度)。
  • 参与/主导一个 Agent 子项目(研判/归因/采集/客服)的优化。

第 3 个月:沉淀 + 扩影响

  • 沉淀方法论:形成可复用的「评估体系 + 数据工程 SOP + 排障手册」。
  • 抽象业务范式:把某一类治理问题的解法标准化,推广到其他业务线。
  • 主动输出:团队早自习/技术直播分享你的实验认知(团队文化鼓励分享)。

前 90 天的三个心法

  1. 先归因,再动手------别急着调参换模型。
  2. 每个迭代都能讲清「改了什么、哪个数变了、变了多少、口径是什么」
  3. 脏活(接数据、清洗、跑报表)是建立业务感知最快的方式,认真做,它是信任的起点。

入职第一周「必问清单」(照着问,别怕显得新)

分四组问完,你就掌握了 80% 的上手信息。建议入职第一天就把这份清单发给 mentor。

A. 业务与指标(最重要的 5 个)

  1. 我们团队当前最核心的 3 个 OKR 是什么?
  2. 线上漏放率 / 误伤率 / 人审介入率 / CCR 的基线是多少?各自口径怎么定义?
  3. 广告、生服、电商三条线,我主要负责哪条?服务哪个具体产品/场景?
  4. 现在最痛的 bad case 类型是什么?(先打这个)
  5. 规则最近一次重大变更是什么?规则 2.0 目前覆盖了哪些范围?

B. 模型与 Mamoda

  1. 基座模型(30B/80B)和 Mamoda 是什么关系?我服务哪一个?
  2. Mamoda 现在的版本、支持哪些模态、延迟和成本大概多少?
  3. Mamoda 的调用/微调方式?能力边界在哪?它现在最不擅长的场景是什么?
  4. 后训练链路:SFT 的数据从哪来?RL 有没有在线上/实验里用?用到什么程度?
  5. 模型评测集在哪、多久更新一次、怎么防泄漏?

C. 数据与系统

  1. 数据在哪个数仓/表?权限怎么申请?常用表名和字段?
  2. 人审/标注团队在哪?标签怎么回流到我这儿?
  3. 评测回归怎么跑?有 CI 或自动化脚本吗?
  4. 灰度 / 影子 / AB 平台怎么用?
  5. 数据看板在哪?指标怎么自己拉?
  6. 推理和训练资源怎么申请?排队情况如何?

D. 协作与节奏

  1. 我的 mentor 是谁?周会/双周会节奏如何?
  2. 和业务方、人审团队、算法团队分别怎么对接?谁是关键接口人?
  3. 一个需求从提出到上线的标准流程是什么?(有没有评审/卡点)
  4. 团队对新人前 30 天的期望是什么?怎样算"上手了"?

第 8 章 术语表(中英对照 + 一句话解释)

术语 一句话解释
CQC 内容质量与数据服务平台(你的部门),负责内容安全与质量、数据与算力基础支持
巨量引擎 字节商业化平台;「商业信任与安全」是其中做广告/商业内容治理的团队
Mamoda 团队自研的广告治理多模态大模型(2026 已到 2.5),你的基模工作大概率围绕它
DiT-MoE Mamoda 2.5 架构:MoE 混合专家 + DiT 扩散融合;128 专家、25B 总参、3B 激活
规则 2.0 把模糊规则重构成结构化"机器语言",结合 SFT/RL 提审精度
全链路治理 风险识别 → 精准定位 → 素材自动修复 的端到端治理
以 AI 治 AI 用大模型对抗 AIGC 违规内容
后链路 广告投放后的履约/体验守护,穿透履约"黑箱"
CCR(消费者抱怨指数) 整合评论/举报/投诉等负反馈的首创指标
机审 / 人审 机器自动审核 / 人工审核;两者是飞轮关系,不是替代关系
准召 / Precision / Recall 精确率(拦下的有多少真违规)/ 召回率(违规里拦到多少)
误伤 / 误报 / FP 把合规判成违规;损失广告收入
漏放 / 漏报 / FN 把违规判成合规;监管舆情风险
黑五类 药品/医疗器械/保健食品/医美/减肥等强监管品类
HITL Human-in-the-Loop,人工介入,低置信/高风险转人工
Harness Agent 运行外壳:提示词、工具协议、上下文管理、循环控制
Context Engineering 上下文工程:管理有限注意力预算里的高信号 token
Context Rot 上下文越长,模型召回能力越低
Compaction 接近窗口上限时摘要历史,用摘要重启新窗口
Agentic Memory Agent 把进展写到窗口外的记忆文件,按需拉回
MCP Model Context Protocol,工具/上下文标准化接入协议
A2A Agent-to-Agent,Agent 间通信与任务分派协议
Tool Schema / Registry / 参数注入 工具定义 / 注册中心 / 按 Schema 自动填参
Auto-workflow 自动化工作流;确定性外壳 + Agent 内核
Multi-Agent / Supervisor / Router 多 Agent 协作;总控按意图路由到子 Agent
RAG / Hybrid Search / Rerank 检索增强生成 / 稠密+稀疏混合检索 / 交叉编码器精排
SFT / RLHF / RLVR 监督微调 / 人类反馈强化学习 / 可验证奖励 RL
DPO / KTO / PPO / GRPO / GSPO 各类对齐算法(见第 3 章表)
Agentic RL 把 RL 扩展到工具使用/长任务,过程奖励 + 结果奖励
LoRA / QLoRA 低秩适配微调 / 4-bit 量化基座 + LoRA
MoE 混合专家,稀疏激活,总参大、激活小
KV Cache / Prefix Caching 推理键值缓存 / 前缀缓存复用
量化 AWQ/GPTQ/FP8 权重/激活低精度压缩,省显存提吞吐
TP / PP / DP / EP 张量/流水线/数据/专家并行
Model Collapse 模型学自己生成的数据导致退化、多样性丧失
Reward Hacking 模型钻奖励函数空子拿分而非真正做对
LLM-as-Judge 用模型给模型打分(评估方法之一)
Shadow Mode / 灰度 影子模式(不生效只观察)/ 小流量放量
Bad Case 模型判错的样本
Data Flywheel / 数据飞轮 回流数据持续提升模型的闭环
STW Stop The World,GC 暂停应用线程
AIGC AI 生成内容(审核的新对象,也是新工具)

第 9 章 学习资源清单

后训练 / RL

  • InstructGPT(RLHF 范式)、LIMA(少样本 SFT)、DeepSeek-R1/V3(GRPO、RL 工程化)、Qwen 技术报告(GSPO)、Kimi K2/K3(分任务 RL + 合并)。
  • 关键词检索:SFTRLHFDPOGRPORLVRAgentic RLreward model

Agent 工程

  • Anthropic《Building Effective Agents》:workflow vs agent、六大模式、ACI/工具设计。
  • Anthropic《Effective Context Engineering for AI Agents》:context rot、compaction、note-taking、sub-agent、just-in-time。
  • 12-Factor Agentsgithub.com/humanlayer/12-factor-agents):生产级 Agent 12 条原则。
  • LangGraph / MCP / A2A 官方文档;Claude Code 的 Harness / Skills / Hooks 设计。
  • 关键词检索:agent harnesscontext engineeringmulti-agent supervisoragent evaluation

内容安全 / 审核

  • OpenAI《Using GPT-4 for content moderation》:策略→黄金集→模型标注→差异分析→蒸馏小模型 的迭代流程。
  • Llama Guard 等安全分类器论文。
  • 平台规则文档(内部):入职后第一优先级,比任何外部资料都重要。

基础

  • Transformer(Attention Is All You Need)、MoE 综述、量化综述、vLLM/PagedAttention。
  • 关键词检索:MoEquantizationKV cachespeculative decoding

建议的学习节奏(读 → 做 → 用)

  1. :论文/技术报告原文(配方细节只在报告里)。
  2. :小规模复现(QLoRA、GRPO 跑通一遍)。
  3. :在项目里落地(数据工程、评测闭环),印象才深。

第 10 章 避坑与潜规则

技术侧

  • 一上来就调 prompt / 换模型:先归因,瓶颈常在数据/流程。
  • 只看离线指标:离线提升 ≠ 线上提升,最终看业务指标。
  • 一次改多处:分不清是谁的功劳,每次只改一处 + 同一套回归。
  • 训练/评测数据泄漏:时间切分隔离,否则效果被严重高估。
  • 忽略标签质量 :训练集混入误伤样本,模型就学会误伤广告主。标签可信 > 数据量。
  • 过度设计 Agent:能用单 Agent/Workflow 就别上 Multi-Agent/Agent。
  • 上下文无限膨胀:用 compaction/note-taking/just-in-time。

业务/协作侧

  • 只谈技术方案、指标、机制------JD 明确「纯技术画像,产品向不 OK」。不和稀泥、不空谈产品体验。
  • 数字永远讲口径:被质疑时讲清样本定义、对比基准,别闪烁其词。
  • 被挑战时稳住:Leader 要的是真实性和逻辑,不是完美数字。不会就承认 + 给思路。
  • 主动抛钩子:每个项目准备「可深挖的技术点」,掌握节奏。
  • 快速行动 + 坦诚清晰:字节文化。有问题直接摆数据、摆证据。
  • 不要抱怨运营序列:理解成「做算法的事、要业务的结果」,主动对齐。
  • 输出即影响力:团队每周 2 场直播、每日早自习,鼓励分享------把你的实验认知写出来、讲出来。

心态

  • 前 90 天不会马上接触核心训模,可能先接数据、清洗样本、跑报表------把它当「第一个该拿下的山头」
  • 没训过 30B/80B 不可怕,方法论可迁移;诚实说规模上是新人,落到数据配方和后训练。
  • 深度本身就能带来成长,不需要靠频繁跳转换取成长。

第 11 章 速查卡(Cheat Sheet)

一句话记住岗位

后训练让模型「懂规矩」,Agent 让系统「会干活」,数据飞轮让两者「越用越强」,准召和成本是最终裁判。

团队真实主线(巨量引擎商业安全)

CQC 造能力 × 巨量引擎商业信任与安全 用能力

Mamoda(多模态治理大模型)· 规则 2.0(机器可读规则)· 后链路守护 · CCR 消费者抱怨指数

核心理念:全链路治理 + 以 AI 治 AI;从"单向拦截"到"主动赋能"

业务硬指标(能被引用)

90% 素材 10 分钟内审完 · 效率 +75% · Q3 前置拦截 84 万+ · 日均 1500 万条拒审诊断 · 日修复超百万条

机审漏斗

资质准入 → 规则/知识库 → 小模型初检 → 大模型精判 → 人审兜底 → 闭环回流

准召口诀

漏放代价 > 误伤代价 → 冷启动高召回 → 高置信自动处置 → 低置信转人审 → 回流收紧阈值

后训练口诀

SFT 建基线 → DPO 调安全偏好 → GRPO/RLVR 做可验证 → PPO+RM 关键路径

Agent 口诀

LLM + tools in a loopWorkflow 确定外壳 + Agent 长尾内核能用单 Agent 就不上多 Agent

上下文三技法

Compaction(压缩)· Note-taking(笔记)· Sub-agent(子智能体)

排障三步

指标定位 → 分层归因 → 每次只改一处

事故三步

先止血 → 再追因 → 再防复发

每日循环(真实工作节奏)

看数 → 挑 bad case/申诉推翻样本 → 归因(数据/模型/规则/流程) → 最小动作 → 离线+灰度 → 看业务指标 → 回流+写周报

入职第一天

把「必问清单 20 问」发给 mentor,先搞懂:我的 OKR、我服务哪条线、Mamoda 和基座的关系、数据在哪、评测怎么跑

迭代验证三件套

离线评测 + 影子/灰度 + 业务指标(按类别拆)

四个必须能秒答的业务指标

漏放率 · 误伤率 · 人审介入率 · 单条成本

评测三层

通用能力 → 业务专测集(含边界/对抗)→ 链路级

置信度两路信号

模型把握(类间摇摆) + 规则校验(字段/特征/矛盾)→ 合成 → 阈值按 PR 曲线定

数字挑战应对模板

「口径是同一时段、同一规则下,X 样本数 / 总样本数的对比。如果您想复核,我可以讲清楚样本定义和计算方式。」


最后一句 :这份手册已经把「业务场景 + 技术主轴 + 操作流程 + 必问清单」四层都补齐了。业务黑话一周吃透,第 3、4 章的后训练与 Agent 两大主轴做深,再用「入职第一周必问清单」把内部系统/数据/评测/口径对齐------你就能比任何人都快地 landing。

先归因,再动手;拿数据说话;把闭环转快。冲。

相关推荐
子兮曰2 小时前
jev-ultrafast 深度解析:7 秒订机票的浏览器 Agent 是如何炼成的
前端·后端·agent
回眸&啤酒鸭2 小时前
【回眸】Minicart 电商购物车核心功能落地指南
人工智能
子兮曰2 小时前
Jev 爆发一周:7 秒 Agent 背后的 System One 生态与三场争议
前端·后端·ai编程
一隅论数智2 小时前
给AI一张“业务概念地图“:本体如何从哲学走向企业智能
大数据·人工智能·经验分享·笔记·学习·学习方法·政务
AI的探索之旅2 小时前
97 个 OpenCV 实例(三十):双目立体,从标定到点云
人工智能·opencv·计算机视觉
AlbertZein2 小时前
Step-5-Preview 上手实测:3D 游戏、金融分析、网页设计一次跑完
人工智能·aigc
前端小万2 小时前
写公众号赚了 3000 块后,我做了一款叫 "一键成稿" 的软件
前端·微信小程序
LaughingZhu2 小时前
Product Hunt 每日热榜 | 2026-09-19
人工智能·深度学习·神经网络·搜索引擎·百度
爱勇宝2 小时前
ZCode 开源 24 小时:一份没有历史的账本,回答不了"有没有偷代码"
前端·后端·chatglm (智谱)